Am 1. Oktober 2026 hat Jack Brody, Chief Product Officer des KI-Musikunternehmens Suno, im offiziellen Blog bekannt gegeben, dass Speech (Beta), ein neues Sprach-Audiomodell, nach einem Monat Tests in kleiner Runde nun für alle Nutzer geöffnet ist. Suno nennt es „das erste Audiomodell, das Stimme und Musik gemeinsam als einen zusammenhängenden Track erzeugt" (the first audio model that generates voice and music together as one cohesive track).
Ein Durchgang: Stimme und Soundtrack sind keine zwei Schritte mehr
Speech ist denkbar einfach zu bedienen: Man gibt einen Text in Suno ein – eine Idee, ein Gedicht oder einen beliebigen bereits geschriebenen Text – beschreibt dann die gewünschte Stimme und den Musikstil, und das Modell gibt gesprochene Sprache mit originaler Hintergrundmusik aus, verschmolzen zu einem einzigen einheitlichen Audiotrack.
Bislang brauchte ein „gelesener Beitrag mit Musik" meist drei Schritte: erst trockene Sprachaufnahmen per Sprachsynthese erzeugen, dann einen passenden Musiktitel suchen, schließlich mischen und synchronisieren. Speech komprimiert diese drei Schritte in eine einzige Generierung – Stimme und Musik wachsen von Anfang an gemeinsam, was den Übergang theoretisch natürlicher macht und die Suche nach lizenzierter Musik sowie das Abmischen erspart.
Vom „Singen" zum „Sprechen": Suno spannt eine weitere Leinwand auf
Um Speech zu verstehen, sollte man es in Sunos Produkt-Roadmap dieses Jahres einordnen. Das Unternehmen startete mit KI-Musikgenerierung und brachte im März mit dem v5.5-Modell die Stimmklon-Funktion Voices heraus; Speech erweitert das Terrain vom „Singen" aufs „Sprechen". Brody schrieb im Blog, Musik bleibe Sunos Kern, doch die Vision des Unternehmens reiche inzwischen zu anderen Formen menschlichen Ausdrucks – Speech nannte er „eine weitere Leinwand" (another canvas) für die Kreationen der Community.
Die offiziellen Beispiele sind lebensnah: die SMS eines Freundes in eine „wild überproduzierte dramatische Lesung" verwandeln, einer gewöhnlichen Sprachnachricht einen „unnötig epischen Score" unterlegen – neben praktischeren Anwendungen wie Meditationsanleitungen, Gedichtlesungen, Motivationsansprachen und Gutenachtgeschichten für Kinder. Suno fasst diese Nachfrage unter „Creative Entertainment" zusammen und glaubt, dass sie die nächste Welle der Consumer-Technologie definieren wird.
Wer wird es zuerst nutzen
Zwei Gruppen dürften zuerst profitieren: Podcast- und Audio-Content-Ersteller, die bislang Sprecher und Musik für Intro, Übergänge und Outro getrennt beschaffen mussten und beides nun in einem Modell in einem Zug erzeugen können; sowie Short-Video- und Social-Media-Creator, für die meme-artige „dramatische Lesungen" wie für die Verbreitung gemacht sind. Voraussetzung ist natürlich stabile Generierungsqualität – und Suno selbst hat im Blog vorsorglich abgewiegelt.
Drei Dinge, die die offizielle Ankündigung offenließ
Drei Dinge wurden im offiziellen Blog nicht angesprochen. Erstens Preise und Tarife: Der Beitrag sagt nicht, in welchen Plänen Speech verfügbar ist oder wie viel kostenlose Nutzer davon nutzen können. Zweitens Plattformen: Unterschiede zwischen Web- und Mobilnutzung werden nicht erläutert. Drittens – und für ein Sprachmodell der wichtigste Punkt – sagt der Beitrag nichts zu Stimm-Lizenzierung und Inhaltsmoderation: Woher die erzeugten Stimmen stammen, wessen Stimme imitiert werden darf und welche Nutzungsgrenzen gelten, bleibt unerwähnt; es gibt nur einen Beta-Haftungsausschluss, der scherzt, dass „britische Akzente gelegentlich nach Australien abwandern und zurückkehren".
Diese Lücken bedeuten nicht zwangsläufig Probleme – in der Beta-Phase erst das Feature zu liefern und Richtlinien nachzuziehen, ist ein üblicher Rhythmus. Für Creator, die Speech in echten Produktionen einsetzen wollen, ist es jedoch sicherer, vor dem Loslegen einen Blick in die aktuellen Release Notes und Community-Richtlinien zu werfen.