Google a annoncé sur son blog officiel avoir apporté d’importantes améliorations aux modèles de synthèse vocale (TTS) Gemini 2.5 Flash et Gemini 2.5 Pro. Cette mise à jour vise à améliorer la diversité des émotions et des tons, le respect des instructions de style et la cohérence dans les dialogues multi-personnages, visant à donner aux développeurs un contrôle plus granulaire sur le style et la sensation d’écoute des voix synthétiques.
En termes de contrôle du rythme, la nouvelle version peut ajuster la vitesse de la parole avec une parole contextuelle en fonction du contenu du texte, par exemple en ralentissant automatiquement lors de l’explication d’un contenu complexe, en accélérant le rythme dans les paragraphes tendus ou énergiques, et en exécutant mieux les commandes claires de rythme et de pause. La capacité multi-haut-parleurs a également été améliorée pour maintenir le ton, le ton et l’ambiance de différents personnages dans des scénarios tels que les podcasts, les interviews virtuelles et la narration, tout en maintenant des performances cohérentes dans les 24 langues déjà prises en charge par le modèle.
Actuellement, Gemini 2.5 Flash TTS (accent sur la faible latence) et 2.5 Pro TTS (accent sur la qualité sonore et l’expressivité) sont ouverts aux développeurs de Google AI Studio via l’API Gemini, remplaçant la version TTS précédente sortie en mai de cette année. L’industrie s’attend à ce que cette technologie TTS hautement contrôlable automatise davantage les livres audio, l’éducation en ligne, le marketing localisé et la production de contenus par les créateurs, mais elle impose également des exigences plus strictes en matière de conformité au droit d’auteur et de prévention des abus de synthèse vocale.
FAQ
Q : Quelles fonctionnalités ont principalement été mises à jour dans Gemini 2.5 Flash et Pro TTS cette fois-ci ?
R : Cette mise à jour vise à améliorer la diversité émotionnelle et tonale, le contrôle de la vitesse et du rythme conscients du contexte, ainsi que la cohérence et la stabilité vocales lors des conversations multi-haut-parleurs et multi-personnages.
Q : Pour quels cas d’utilisation Gemini 2.5 Flash TTS et 2.5 Pro TTS sont-ils adaptés ?
R : Flash TTS est destiné aux scénarios d’interaction à faible latence, tels que les conversations d’assistant et les applications interactives ; Pro TTS est plus adapté à la production de contenus tels que les livres audio, la narration d’intrigue et les vidéos marketing qui recherchent une qualité sonore élevée et une forte expressivité.
Q : Quelles langues et régions sont actuellement prises en charge pour Gemini 2.5 TTS ?
R : Gemini 2.5 Flash et Pro TTS sont disponibles pour les développeurs dans l’API Gemini en tant que modèles de prévisualisation, couvrant 24 langues prises en charge, et des langues et régions spécifiques peuvent être consultées dans la documentation correspondante.
Q : Comment les développeurs peuvent-ils accéder aux capacités TTS de cette mise à jour dans leurs produits ?
R : Les développeurs peuvent choisir un modèle 2.5 Flash ou 2.5 Pro avec des capacités TTS dans Google AI Studio via l’API Gemini, configurer le style vocal, le tempo et les paramètres multi-haut-parleurs dans le terrain de jeu ou le code d’exemple, et les intégrer dans leurs propres applications.
Q : Le modèle Gemini TTS précédent peut-il encore être utilisé ?
R : Google a clairement indiqué que la nouvelle version de Gemini 2.5 Flash et Pro TTS remplacera l’ancien modèle TTS sorti en mai de cette année, et que l’itération des capacités qui suivra sera basée sur ce nouveau modèle, et il est recommandé aux développeurs de migrer la configuration et la logique d’appel dès que possible.