KI-Spracherkennung
Beschreibt, wie Modelle wie Qwen3-ASR und Whisper Sprache aus Meetings, Interviews und Videos in Text wandeln und so Transkription, Untertitel und Live-Diktat abdecken.
KI-Spracherkennung (ASR) lässt Modelle gesprochene Sprache direkt in Text wandeln und deckt Meeting-Notizen, Interview-Transkripte, Video-Untertitel und Live-Diktat ab. Systeme wie Qwen3-ASR, Fun-ASR und Whisper halten selbst in Lärm, Dialekten und über 30 Sprachen niedrige Fehlerraten, doch Eigennamen, Homophone und starker Akzent brauchen weiterhin eigene Vokabulare und menschliches Korrekturlesen.