Le 23 septembre 2026, Google DeepMind a présenté sur son blog officiel Gemini 3.8 Flash TTS et Flash-Lite TTS, décrits comme les modèles de génération audio les plus expressifs à ce jour. Les nouveaux modèles savent concevoir des voix à partir de zéro avec des prompts en langage naturel, cloner une voix à partir d'un échantillon de 30 secondes, diriger des interprétations ligne par ligne, générer des audios longs et orchestrer des dialogues à deux voix — dans plus de 100 langues.
D'abord, la différence avec la génération précédente. L'ancien TTS, c'était « choisir une voix » : en prendre une dans une bibliothèque de voix prédéfinies, ajuster la vitesse et l'intonation. Les nouveaux modèles, c'est « créer des voix » et « diriger des interprétations » : écrivez « une voix de radio de fin de soirée, chaleureuse et légèrement rauque », et le modèle la génère ; donnez-lui un enregistrement de 30 secondes et il clone la voix de quelqu'un ; les longues lectures peuvent recevoir une direction émotionnelle ligne par ligne, et dans les scènes à deux voix, le modèle orchestre les tours de parole. Flash-Lite est la variante plus légère, axée sur la faible latence et le faible coût pour les scénarios temps réel.
Où ils arrivent — et qui en profite en premier
Les deux modèles sont disponibles simultanément dans Google AI Studio, l'API Gemini, Gemini Enterprise, Gemini Notebook et Google Vids. Trois publics ressentiront l'effet en premier : les producteurs de podcasts et de livres audio, dont le flux de production correspond directement à la génération longue et à la direction ligne par ligne ; les créateurs vidéo, qui peuvent troquer la narration dans Google Vids contre des voix sur mesure ; les équipes formation et support en entreprise, où l'orchestration à deux voix convient aux contenus pédagogiques conversationnels. Fait notable : le même jour, Qwen d'Alibaba a également dévoilé une famille de modèles vocaux, Qwen-Audio-3.1 (notre couverture (/article/2056-a-li-qwen-fa-bu-qwen-audio-3-1-yi-kou-qi-wu-kuan-yu-yin-mo-xing-asr-jiang-jia-9)) — la course dans le domaine vocal s'accélère nettement cette semaine.
Plus la capacité est forte, plus les limites doivent être claires
Un clonage de voix en 30 secondes soulève d'abord la question du risque : cloner la voix de quelqu'un sans son consentement touche aux droits de la voix et de l'image dans la plupart des juridictions — la chaîne d'autorisations doit être vérifiée avant tout usage commercial. Et « les plus expressifs à ce jour » est l'affirmation officielle ; la qualité réelle demande des tests multilingues, notamment pour savoir si le rythme et les pauses sonnent naturels dans de longs textes chinois. Ce genre de détails ne se révèle généralement qu'une fois que les développeurs s'en emparent vraiment.