Google gab in seinem offiziellen Blog bekannt, dass es wichtige Upgrades an den Gemini 2.5 Flash- und Gemini 2.5 Pro-Text-to-Speech-(TTS)-Vorschaumodellen vorgenommen hat. Dieses Update konzentriert sich darauf, die Vielfalt von Emotionen und Ton, die Einhaltung von Stilanweisungen und die Konsistenz in mehrcharakterigen Dialogszenarien zu verbessern, mit dem Ziel, den Entwicklern eine detailliertere Kontrolle über den Stil und das Hörgefühl synthetischer Stimmen zu geben.
Was die Rhythmussteuerung betrifft, kann die neue Version die Sprachgeschwindigkeit mit kontextbewusster Sprache basierend auf dem Inhalt des Textes anpassen, etwa durch automatisches Verlangsamen beim Erklären komplexer Inhalte, Beschleunigung des Tempos in spannenden oder energiegeladenen Absätzen und bessere Ausführung klarer Rhythmus- und Pausebefehle. Die Mehrsprecherfunktion wurde außerdem verbessert, um Ton, Ton und Stimmung verschiedener Charaktere in Szenarien wie Podcasts, virtuellen Interviews und Erzählungen zu erhalten und eine konsistente Leistung in den 24 Sprachen zu gewährleisten, die das Modell bereits unterstützt.
Derzeit stehen Gemini 2.5 Flash TTS (Betonung geringer Latenz) und 2.5 Pro TTS (Fokus auf Klangqualität und Ausdruckskraft) Entwicklern in Google AI Studio über die Gemini-API offen und ersetzen damit die frühere TTS-Version, die im Mai dieses Jahres veröffentlicht wurde. Die Branche erwartet, dass diese hochkontrollierbare TTS-Technologie Hörbücher, Online-Bildung, lokales Marketing und die Erstellung von Creator-Inhalten weiter automatisieren wird, stellt aber auch höhere Anforderungen an Urheberrechtscompliance und die Verhinderung von Sprachsynthesemissbrauch.
FAQ
F: Welche Funktionen wurden diesmal hauptsächlich in Gemini 2.5 Flash und Pro TTS aktualisiert?
A: Dieses Update konzentriert sich darauf, emotionale und tonale Vielfalt, kontextbewusste Geschwindigkeits- und Rhythmuskontrolle sowie stimmliche Konsistenz und Stabilität während Gesprächen mit mehreren Lautsprechern und mehreren Charakteren zu verbessern.
F: Für welche Anwendungsfälle sind Gemini 2.5 Flash TTS und 2.5 Pro TTS geeignet?
A: Flash TTS richtet sich an Interaktionsszenarien mit geringer Latenz, wie Assistentengesprächen und interaktiven Anwendungen; Pro TTS eignet sich besser für die Content-Produktion wie Hörbücher, Handlungserzählung und Marketingvideos, die eine hohe Klangqualität und starke Ausdruckskraft anstreben.
F: Welche Sprachen und Regionen werden derzeit für Gemini 2.5 TTS unterstützt?
A: Gemini 2.5 Flash und Pro TTS stehen Entwicklern in der Gemini-API als Vorschaumodelle zur Verfügung, die 24 unterstützte Sprachen abdecken, und spezifische Sprachen und Regionen können in der entsprechenden Dokumentation eingesehen werden.
F: Wie können Entwickler auf die TTS-Funktionen dieses Updates in ihren Produkten zugreifen?
A: Entwickler können über die Gemini-API ein 2.5 Flash- oder 2.5 Pro-Modell mit TTS-Funktionen in Google AI Studio auswählen, Stimmstil, Tempo und Multi-Lautsprecher-Parameter im Spielplatz oder Beispielcode konfigurieren und diese in ihre eigenen Anwendungen integrieren.
F: Kann das vorherige Gemini-TTS-Modell noch verwendet werden?
A: Google hat klargestellt, dass die neue Version von Gemini 2.5 Flash und Pro TTS das alte TTS-Modell ersetzen wird, das im Mai dieses Jahres veröffentlicht wurde, und die anschließende Fähigkeits-Iteration wird auf dem neuen Modell basieren; es wird empfohlen, dass Entwickler die Konfiguration und Aufruflogik so schnell wie möglich migrieren.