ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Informations sur l’IA
MAI-Transcribe-2-Streaming : le modèle vocal de Microsoft écrit pendant qu'il écoute

MAI-Transcribe-2-Streaming : le modèle vocal de Microsoft écrit pendant qu'il écoute

Informations sur l’IA • Admin • • 5 vues

MAI-Transcribe-2-Streaming a été publié le 1er octobre 2026 par Microsoft AI sur son blog officiel, aux côtés des modèles de synthèse vocale MAI-Voice-2.1 et MAI-Voice-2.1-Flash, plus rapide. Microsoft présente les trois modèles comme un kit pour agents vocaux : l'un écoute, l'autre parle, et le temps laissé au modèle de raisonnement entre les deux est volontairement compressé.

Écrire pendant l'écoute, agir avant la fin de la phrase

MAI-Transcribe-2-Streaming est le premier modèle de transcription en continu de Microsoft. Au lieu d'attendre la phrase complète, il produit ses premières transcriptions provisoires en un peu plus de 100 millisecondes à partir d'un flux audio continu, les révise à mesure que le contexte arrive et fige le texte final dès la fin de l'énoncé. Dans les évaluations de Microsoft pour la dictée et le sous-titrage, les mots apparaissent environ deux fois plus vite que chez le concurrent le plus proche, et Artificial Analysis le classe premier en précision, pour les transcriptions finales comme provisoires. Il couvre 60 langues avec détection automatique et continue, au tarif de lancement de 0,54 dollar par heure d'audio jusqu'à fin 2026.

Une seule voix, 23 langues

MAI-Voice-2.1 est le modèle de synthèse vocale multilingue le plus abouti de Microsoft à ce jour : 23 langues et 26 variantes régionales, à 22 dollars par million de caractères. Sa particularité : une même voix garde son identité d'une langue à l'autre, en anglais, en mandarin ou en allemand, avec l'accent local naturel. La variante Flash couvre les mêmes langues, génère 45 secondes d'audio avec environ 150 millisecondes de latence, infère 55 % plus vite et coûte 15 dollars par million de caractères. Les deux modèles clonent une voix à partir de quelques secondes d'audio de référence, avec des garde-fous de consentement contre les abus.

Pourquoi Microsoft fabrique ses propres oreilles et sa bouche

Un agent vocal est une boucle : entendre, comprendre, décider, parler, le tout dans le rythme d'une conversation naturelle. Gagner quelques centaines de millisecondes à l'écoute comme à la parole libère du temps pour le raisonnement et les appels d'outils au milieu. Un agent de service client peut commencer à identifier une demande avant que l'appelant ait terminé, un assistant multilingue peut détecter la langue et répondre avec la même voix, et un produit éducatif n'a plus à changer de professeur à chaque langue. Réserve utile : ces 100 millisecondes mesurent le délai du modèle jusqu'au résultat provisoire, pas la réactivité de toute la chaîne vocale, que le réseau et l'application continuent d'influencer.

Outils Recommandés

Plus