Am 23. September 2026 hat Google DeepMind im offiziellen Blog Gemini 3.8 Flash TTS und Flash-Lite TTS vorgestellt – laut Ankündigung die ausdrucksstärksten Audiogenerierungsmodelle bislang. Die neuen Modelle können Stimmen per natürlichsprachlichem Prompt von Grund auf designen, eine Stimme aus einer 30-Sekunden-Probe klonen, Performances Zeile für Zeile inszenieren, lange Audios erzeugen und Zwei-Personen-Dialoge orchestrieren – in über 100 Sprachen.
Zuerst der Unterschied zur Vorgängergeneration. Klassisches TTS hieß „Stimme wählen": eine aus der Preset-Bibliothek aussuchen, Tempo und Tonlage anpassen. Die neuen Modelle heißen „Stimmen erschaffen" plus „Performances inszenieren": „Warme, leicht raue Late-Night-Radiostimme" schreiben genügt, und das Modell erzeugt sie; 30 Sekunden Aufnahme genügen, um jemandes Stimme zu klonen; lange Lesungen lassen sich zeilenweise mit Emotionen versehen, und in Zwei-Personen-Szenen orchestriert das Modell die Sprecherwechsel. Flash-Lite ist die leichtere Variante mit Fokus auf niedrige Latenz und geringe Kosten für Echtzeitszenarien.
Wo sie landen – und wer zuerst profitiert
Beide Modelle stehen gleichzeitig in Google AI Studio, der Gemini API, Gemini Enterprise, Gemini Notebook und Google Vids bereit. Drei Gruppen spüren den Effekt zuerst: Podcast- und Hörbuchproduzenten, deren Produktionsablauf direkt auf Langform-Generierung plus zeilenweise Regie passt; Videocreator, die die Vertonung in Google Vids gegen Custom Voices tauschen können; Unternehmensschulung und Support, wo Zwei-Sprecher-Inszenierung zu dialogischen Lerninhalten passt. Bemerkenswert: Am selben Tag hat Alibabas Qwen ebenfalls eine Sprachmodellfamilie vorgestellt, Qwen-Audio-3.1 (unsere Berichterstattung (/article/2056-a-li-qwen-fa-bu-qwen-audio-3-1-yi-kou-qi-wu-kuan-yu-yin-mo-xing-asr-jiang-jia-9)) – der Wettbewerb im Voice-Bereich beschleunigt sich diese Woche spürbar.
Je stärker die Fähigkeit, desto klarer müssen die Grenzen sein
Eine Stimmklonung in 30 Sekunden wirft zuerst die Risikofrage auf: Die Stimme eines Menschen ohne Einwilligung zu klonen, berührt in den meisten Rechtsordnungen Stimm- und Persönlichkeitsrechte – vor kommerziellem Einsatz muss die Rechtekette geklärt sein. Und „ausdrucksstärkste bislang" ist die offizielle Behauptung; die wahre Qualität braucht mehrsprachige Tests, etwa ob Rhythmus und Pausen in langen chinesischen Texten natürlich klingen. Solche Details zeigen sich meist erst, wenn Entwickler wirklich Hand anlegen.