ToolNavs KI-Tools entdecken
Tool einreichen Anmelden

KI-Spracherkennung

Beschreibt, wie Modelle wie Qwen3-ASR und Whisper Sprache aus Meetings, Interviews und Videos in Text wandeln und so Transkription, Untertitel und Live-Diktat abdecken.

KI-Spracherkennung (ASR) lässt Modelle gesprochene Sprache direkt in Text wandeln und deckt Meeting-Notizen, Interview-Transkripte, Video-Untertitel und Live-Diktat ab. Systeme wie Qwen3-ASR, Fun-ASR und Whisper halten selbst in Lärm, Dialekten und über 30 Sprachen niedrige Fehlerraten, doch Eigennamen, Homophone und starker Akzent brauchen weiterhin eigene Vokabulare und menschliches Korrekturlesen.