ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Informationen
Google stellt Gemini 3.8 Flash TTS vor: Stimme per Satzbeschreibung designen

Google stellt Gemini 3.8 Flash TTS vor: Stimme per Satzbeschreibung designen

KI-Informationen Admin 4 Aufrufe

Am 23. September 2026 hat Google DeepMind im offiziellen Blog Gemini 3.8 Flash TTS und Flash-Lite TTS vorgestellt – laut Ankündigung die ausdrucksstärksten Audiogenerierungsmodelle bislang. Die neuen Modelle können Stimmen per natürlichsprachlichem Prompt von Grund auf designen, eine Stimme aus einer 30-Sekunden-Probe klonen, Performances Zeile für Zeile inszenieren, lange Audios erzeugen und Zwei-Personen-Dialoge orchestrieren – in über 100 Sprachen.

Zuerst der Unterschied zur Vorgängergeneration. Klassisches TTS hieß „Stimme wählen": eine aus der Preset-Bibliothek aussuchen, Tempo und Tonlage anpassen. Die neuen Modelle heißen „Stimmen erschaffen" plus „Performances inszenieren": „Warme, leicht raue Late-Night-Radiostimme" schreiben genügt, und das Modell erzeugt sie; 30 Sekunden Aufnahme genügen, um jemandes Stimme zu klonen; lange Lesungen lassen sich zeilenweise mit Emotionen versehen, und in Zwei-Personen-Szenen orchestriert das Modell die Sprecherwechsel. Flash-Lite ist die leichtere Variante mit Fokus auf niedrige Latenz und geringe Kosten für Echtzeitszenarien.

Wo sie landen – und wer zuerst profitiert

Beide Modelle stehen gleichzeitig in Google AI Studio, der Gemini API, Gemini Enterprise, Gemini Notebook und Google Vids bereit. Drei Gruppen spüren den Effekt zuerst: Podcast- und Hörbuchproduzenten, deren Produktionsablauf direkt auf Langform-Generierung plus zeilenweise Regie passt; Videocreator, die die Vertonung in Google Vids gegen Custom Voices tauschen können; Unternehmensschulung und Support, wo Zwei-Sprecher-Inszenierung zu dialogischen Lerninhalten passt. Bemerkenswert: Am selben Tag hat Alibabas Qwen ebenfalls eine Sprachmodellfamilie vorgestellt, Qwen-Audio-3.1 (unsere Berichterstattung (/article/2056-a-li-qwen-fa-bu-qwen-audio-3-1-yi-kou-qi-wu-kuan-yu-yin-mo-xing-asr-jiang-jia-9)) – der Wettbewerb im Voice-Bereich beschleunigt sich diese Woche spürbar.

Je stärker die Fähigkeit, desto klarer müssen die Grenzen sein

Eine Stimmklonung in 30 Sekunden wirft zuerst die Risikofrage auf: Die Stimme eines Menschen ohne Einwilligung zu klonen, berührt in den meisten Rechtsordnungen Stimm- und Persönlichkeitsrechte – vor kommerziellem Einsatz muss die Rechtekette geklärt sein. Und „ausdrucksstärkste bislang" ist die offizielle Behauptung; die wahre Qualität braucht mehrsprachige Tests, etwa ob Rhythmus und Pausen in langen chinesischen Texten natürlich klingen. Solche Details zeigen sich meist erst, wenn Entwickler wirklich Hand anlegen.

Empfohlene Tools

Mehr