Wer einen KI-Podcast machen will, vergleicht zuerst nicht Specs, sondern klärt den Bedarf: Soll eine einzelne Stimme ein Skript vorlesen, oder ein Gespräch zwischen zwei Hosts generiert werden? Diese beiden Kategorien basieren auf völlig unterschiedlicher Technik. Wer den falschen Typ wählt, arbeitet meist umsonst.
Solo-Narration ist im Kern Text-to-Speech: Entscheidend sind Natürlichkeit der Stimme, Rhythmus und Stabilität über lange Passagen. Bei Mehrpersonen-Dialogen geht es um Gesprächsgestaltung: Lassen sich die Sprecher unterscheiden, klingen die Übergänge flüssig, fühlt sich das Tempo wie ein echtes Gespräch an? Passt das Werkzeug nicht zur Aufgabe, rettet auch die beste Audioqualität nichts.
Zuerst klären: die vier echten Bedürfnisse
- Solo-Narration: Nachrichten, Audio-Inhalte, Erklärformate – eine Stimme von Anfang bis Ende.
- KI-generierter Mehrpersonen-Dialog: Dokumente in eine Zwei-Hosts-Talkshow verwandeln.
- Aufgezeichnete echte Dialoge: bereits aufgenommen, brauchen Transkription, Schnitt und Bereinigung.
- Video-Podcast: zusätzlich auf Videoplattformen – Bild und Untertitel werden gebraucht.
Bedarfsmatrix
| Worauf achten | Solo-Narration | Mehrpersonen-Dialog (KI-generiert) |
|---|---|---|
| Kernfähigkeit | TTS-Stimmqualität und Langform-Stabilität | Sprechertrennung und Gesprächsrhythmus |
| Chinesisch-Anforderung | Rhythmus, Dialekte, mehrdeutige Zeichen | Natürlichkeit chinesischer Dialoge |
| Größtes Risiko | Lange Passagen klingen roboterhaft | Zwei Stimmen klingen wie eine Person, die schauspielert |
| Nachbearbeitung | Gering – die Ausgabe ist fast fertig | Mittel – Dialoglogik muss geprüft werden |
Tool-Vergleich
| Tool | Stärke | Chinesisch | Preis | Positionierung |
|---|---|---|---|---|
| NotebookLM | KI-generierter Mehrpersonen-Dialog | 50+ Sprachen inkl. vereinfachtem Chinesisch | Kostenlos | Dokumente per Klick in eine Zwei-Hosts-Talkshow |
| ElevenLabs | Solo-Narration | 32 Sprachen inkl. Chinesisch | Gratis-Kontingent + Zeichenabrechnung | Natürliche Stimmen mit Voice-Cloning |
| VibeVoice-1.5B | KI-generierter Mehrpersonen-Dialog | Selbst testen | Open Source, selbst gehostet | Microsofts Open-Source-Mehrsprecher-Langform-Stimme |
| Descript | Nachbearbeitung aufgezeichneter Dialoge | Englisch zuerst | Kostenpflichtiges Abo | Textbasierter Schnitt – Audio schneiden wie ein Dokument |
| Chinesische TTS-Dienste | Solo-Narration | Stark | Nutzungsbasiert oder Abo | Chinesischer Rhythmus und Dialektstimmen sind die Stärke |
Jedes Tool im Einzelnen
NotebookLM: der kostenlose Zwei-Hosts-Dialoggenerator
Von Google – Dokumente hochladen und eine Audio-Show mit zwei KI-Hosts im Gespräch erhalten, in über 50 Sprachen inklusive vereinfachtem Chinesisch, kostenlos. Ideal, um Berichte und Lesestoff in pendeltaugliches Hören zu verwandeln.
Nicht geeignet für: alle, die Solo-Narration wollen. Es erzeugt nur Zwei-Hosts-Dialoge – eine feste Host-Stimme lässt sich nicht zuweisen. Auch nicht für kommerzielle Projekte, die eine Markenstimme brauchen.
ElevenLabs: Spitzenklasse für Solo-Narration
32 Sprachen, riesige Stimmenbibliothek, dazu Voice-Cloning – emotionale Darbietung und Pausensetzung bei Langform-Narration gehören zum Natürlichsten, was TTS derzeit bietet. Das Gratis-Kontingent (rund 10.000 Zeichen pro Monat) reicht zum Ausprobieren.
Nicht geeignet für: alle, die per Klick Zwei-Hosts-Dialoge wollen. Es ist im Kern ein Vorlese-Tool; Gespräche mit mehreren Rollen müssen manuell zusammengesetzt werden. Lange Serien verbrauchen das Zeichenkontingent schnell – bei knappem Budget vorher durchrechnen.
VibeVoice-1.5B: selbst hostbare Mehrsprecher-Option
Microsofts Open-Source-Sprachsynthese in Podcast-Qualität erzeugt bis zu 90 Minuten Vier-Personen-Dialog in einem Durchgang – passend für technisch versierte Teams, die ihre eigene Pipeline bauen wollen. Microsofts Open-Source-VibeVoice-1.5B, Mehrsprecher-Stimme in Podcast-Qualität (/article/132)
Nicht geeignet für: normale Nutzer, die sich nicht mit Deployment befassen wollen. Rechenleistung, Feintuning und chinesische Qualitätsprüfung liegen alle bei dir – der Zeitaufwand ist real.
Descript: das Schnitt-Arbeitstier für aufgezeichnete Dialoge
Bei von Menschen aufgenommenen Mehrpersonen-Gesprächen liegt der Schmerz nicht in der Generierung, sondern in der Nachbearbeitung: Transkription, Füllwort-Entfernung, Mehrspur-Abgleich. Descript verwandelt Audio in editierbaren Text – einen Satz löschen heißt, dieses Audio-Segment löschen. Descripts textbasierter Podcast-Schnitt (/article/663)
Nicht geeignet für: alle, die einen Podcast aus dem Nichts generieren wollen. Es erschafft nichts – ohne Aufnahmen ist es nutzlos. Chinesische Transkription hinkt dem Englischen hinterher.
Chinesische Solo-Narration: chinesischen Rhythmus priorisieren
Für rein chinesische Solo-Shows lohnen sich einheimische TTS-Dienste zuerst: mehrdeutige Zeichen, Zahlenlesung und Dialektstimmen kommen meist geschmeidiger heraus. Beim Vergleich auf Pausen und Betonung in langen Absätzen achten – nicht nur auf die ersten drei Sätze der Demo.
Nicht geeignet für: alle, die mehrsprachige Versionen brauchen. Chinesische TTS-Engines sprechen Englisch meist weniger natürlich als native mehrsprachige Modelle.
Drei Auswahlregeln
- Erst das Show-Format festlegen, dann das Tool wählen. Solo-Narration heißt TTS, Mehrpersonen-Dialog heißt Gesprächsgestaltung, aufgezeichnete Shows heißen Schnitt-Tools. Falsches Format – und alles danach ist falsch.
- Chinesische Shows mit chinesischem Skript testen. Die Lücke in der Natürlichkeit chinesischer Dialoge zwischen den Tools ist groß – jeweils drei Minuten aus dem eigenen Skript generieren und vergleichen; offizielle Demos nicht glauben.
- Kostenlos starten, erst zahlen, wenn der Workflow läuft. Die Gratis-Kontingente reichen zur Validierung – erst abonnieren, wenn die Veröffentlichungsfrequenz sicher steht.
Alternative: Wenn nichts voll überzeugt, ist ein Hybrid-Stack oft verlässlicher – chinesisches TTS für Solo-Parts, transkribierte und polierte Aufnahmen für Dialoge. Dieser Leitfaden behandelt die Auswahl von Transkriptions- und Untertitel-Tools (/article/1862). Um auch auf Videoplattformen zu veröffentlichen, einfach einen Videoschnitt-Schritt obendrauf setzen.
Häufige Fragen
F: Geht ein ordentlicher KI-Podcast ganz ohne Budget?
A: Ja. NotebookLM erzeugt Zwei-Hosts-Dialoge gratis, und ElevenLabs' Gratis-Kontingent reicht für ein paar kurze Episoden. Erst die inhaltliche Richtung validieren, den Veröffentlichungsrhythmus finden, dann über Bezahlen nachdenken.
F: Ist KI-generierter chinesischer Mehrpersonen-Dialog wirklich brauchbar?
A: Eine Stufe unter Englisch. Sprechertrennung und Gesprächsrhythmus fallen im Chinesischen leichter auf – erst mit einer Drei-Minuten-Probe testen, bevor man sich auf eine Serie einlässt.
F: Kann man Tools für Solo- und Dialog-Parts mischen?
A: Ja, aber erwarte nicht, dass ein Tool alles kann. Gängiges Muster: TTS für Solo-Parts, separat generierte oder menschlich aufgenommene Dialoge, dann alles in der Schnittsoftware zu einer Episode zusammensetzen.