ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Informationen
MAI-Transcribe-2-Streaming startet: Microsofts Sprachmodell schreibt mit, während es zuhört

MAI-Transcribe-2-Streaming startet: Microsofts Sprachmodell schreibt mit, während es zuhört

KI-Informationen • Admin • • 5 Aufrufe

MAI-Transcribe-2-Streaming wurde am 1. Oktober 2026 von Microsoft AI im offiziellen Blog veröffentlicht, zusammen mit den Sprachsynthese-Modellen MAI-Voice-2.1 und dem schnelleren MAI-Voice-2.1-Flash. Microsoft bündelt die drei Modelle zu einem Baukasten für Sprachagenten: eines hört zu, eines spricht, und die Zeit für das Denkmodell dazwischen wird gezielt verkürzt.

Mitschreiben beim Zuhören, Handeln vor Satzende

MAI-Transcribe-2-Streaming ist Microsofts erstes Streaming-Transkriptionsmodell. Es wartet nicht auf den vollständigen Satz, sondern liefert aus einem fortlaufenden Audiostrom nach gut 100 Millisekunden erste vorläufige Ergebnisse, korrigiert sie mit wachsendem Kontext und fixiert den endgültigen Text, sobald eine Äußerung endet. In Microsofts Tests zu Diktat und Untertitelung erscheinen Wörter etwa doppelt so schnell wie beim nächsten Wettbewerber, und bei Artificial Analysis belegt das Modell bei der Genauigkeit finaler wie vorläufiger Transkripte Platz eins. Es unterstützt 60 Sprachen mit automatischer, fortlaufender Spracherkennung, zum Einführungspreis von 0,54 US-Dollar pro Audiostunde bis Ende 2026.

Eine Stimme, die 23 Sprachen spricht

MAI-Voice-2.1 ist Microsofts bislang stärkstes mehrsprachiges Sprachsynthese-Modell, mit 23 Sprachen und 26 Sprachvarianten für 22 US-Dollar pro Million Zeichen. Sein Markenzeichen: Eine Stimme bleibt über Sprachen hinweg dieselbe Person, ob auf Englisch, Mandarin oder Deutsch, jeweils mit natürlichem Akzent. Die Flash-Variante unterstützt dieselben Sprachen, erzeugt 45 Sekunden Audio mit rund 150 Millisekunden Gesamtlatenz, rechnet 55 Prozent schneller und kostet 15 US-Dollar pro Million Zeichen. Beide Sprachmodelle klonen Stimmen aus wenigen Sekunden Referenzton und enthalten Einwilligungs-Schutzmechanismen gegen Missbrauch.

Warum Microsoft Ohren und Mund selbst baut

Ein Sprachagent ist eine Schleife: hören, verstehen, entscheiden, sprechen, alles im Rhythmus eines natürlichen Gesprächs. Wer beim Hören und Sprechen je einige hundert Millisekunden spart, gewinnt Zeitbudget für Schlussfolgern und Werkzeugaufrufe dazwischen. Service-Agenten können ein Anliegen erkennen, bevor der Anrufer ausgeredet hat, mehrsprachige Assistenten antworten nach Spracherkennung mit derselben Stimme, und Lernprodukte brauchen keinen neuen Lehrer pro Sprache. Zu beachten: Die gut 100 Millisekunden sind die Zeit des Modells bis zum vorläufigen Ergebnis, nicht die Reaktionszeit der gesamten Sprachkette, die Netz und Anwendung weiter beeinflussen.

Empfohlene Tools

Mehr