ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Informations sur l’IA
Alibaba Qwen lance Qwen-Audio-3.1 : cinq modèles vocaux d'un coup, l'ASR baisse de 95 %

Alibaba Qwen lance Qwen-Audio-3.1 : cinq modèles vocaux d'un coup, l'ASR baisse de 95 %

Informations sur l’IA Admin 3 vues

Le 23 septembre 2026, l'équipe Qwen d'Alibaba a officiellement lancé la famille de modèles vocaux Qwen-Audio-3.1 : cinq nouveaux modèles d'un seul coup, couvrant la reconnaissance vocale (ASR), la synthèse vocale (TTS) et l'interaction vocale en temps réel (Realtime), plus deux tout nouveaux modèles « Next » — Qwen-Audio-3.1-ASR-Next et Qwen-Audio-3.1-TTS-Next. Avec les modèles est arrivée une baisse de prix inhabituellement forte des API vocales : le TTS recule d'environ 70 %, le Realtime d'environ 85 % et l'ASR jusqu'à 95 %. Les API sont déjà disponibles sur la plateforme Qwen AI ; ASR-Next suivra plus tard.

Ce que fait chacun des cinq modèles

  • Qwen-Audio-3.1-ASR : le modèle de base pour la reconnaissance vocale. Points forts : reconnaissance multilingue et des dialectes, compréhension du contexte, polissage natif des transcriptions.
  • Qwen-Audio-3.1-TTS : le modèle de base pour la synthèse vocale — il transforme le texte en voix naturelle.
  • Qwen-Audio-3.1-Realtime : le modèle d'interaction vocale en temps réel, pensé pour les scénarios à faible latence comme les assistants vocaux et le service client par téléphone.
  • Qwen-Audio-3.1-ASR-Next : un nouveau modèle tourné vers la compréhension audio. Il veut dépasser l'ASR — non plus seulement transcrire la parole, mais la « comprendre ».
  • Qwen-Audio-3.1-TTS-Next : celui qu'il faut regarder de près. Officiellement un « modèle de création audio » : à partir d'un script texte, il synthétise en un seul passage dialogues et sons d'ambiance pour produire un paysage sonore complet de qualité cinéma — destiné à la création professionnelle : livres audio, doublage de films, podcasts, jeux.

Ce que représentent les baisses de prix

Ce n'est pas une remise symbolique. Le TTS à environ 70 % moins cher, c'est une heure de narration de livre audio pour moins d'un tiers du prix. Le Realtime à environ 85 % moins cher ramène les dialogues vocaux en temps réel, gourmands en tokens, dans des zones abordables. L'ASR à 95 % moins cher écrase le coût marginal de la transcription. Pour les comptes rendus de réunion, le contrôle qualité des appels et les immenses archives audio — des tâches qui vivent du volume — le calcul devient soudain bien plus favorable.

Pourquoi cette vague de baisses compte

Parce que ce n'est pas que la voix qui baisse. Le 22 septembre, OpenAI a divisé par deux les prix des API de GPT-6 Sol et Luna (OpenAI lance GPT-6 Sol et Luna : les prix des API divisés par deux pour le quotidien (/article/2042-openai-launches-gpt-6-sol-and-luna-api-prices-cut-in-half-for-everyday-work)) ; le même jour, Claude Opus 5.5 d'Anthropic est arrivé avec un coût d'exploitation inférieur d'environ 40 % à son prédécesseur. En appliquant la même tactique à la voix, Qwen déclare la guerre des prix des modèles élargie : de l'inférence textuelle à toute la pile vocale. Celui qui fait baisser les coûts en premier décroche le premier ticket pour les agents vocaux, la traduction en temps réel et le service client par IA.

Deux mises en garde

Premièrement : le « paysage sonore complet en un seul passage » de TTS-Next n'est pas une simple amélioration de qualité, c'est un changement de nature de l'outil créatif. Il raccourcit la chaîne de production des livres audio, des formats courts et des podcasts — des tâches qui exigeaient autrefois enregistrement des dialogues, recherche d'ambiances et mixage pourront peut-être se régler en une seule génération. Mais cela relève aussi la barre des prompts : il faut savoir décrire le son.

Deuxièmement : ASR-Next n'est pas encore disponible, et les baisses concernent les appels API, pas les poids ouverts. Les développeurs qui veulent auto-héberger et faire tourner leur propre inférence n'en profitent pas cette fois et devront attendre les versions suivantes.

Au total, la logique de Qwen-Audio-3.1 est claire : occuper d'un coup, avec une gamme complète, les quatre maillons de la chaîne — écouter, parler, dialoguer en temps réel, créer — puis faire sauter la barrière des prix. Les API vocales deviennent une infrastructure aussi bon marché que les API texte — et pour les équipes qui construisent des produits vocaux, il est temps de refaire les calculs.

Outils Recommandés

Plus