KI-Sprachagent
Erst bei rund hundert Millisekunden Latenz fühlt sich Sprache wie ein Gespräch an. Hier steht, welche Umwandlungen Ende-zu-Ende-Sprache gegenüber der ASR-zu-TTS-Kette überspringt und wie Sprecherwechsel plus Werkzeugaufrufe die Stimme vom Reden zum Erledigen bringen.
Die alte Kette transkribiert, denkt, spricht: langsam, anfällig beim Unterbrechen. Ende-zu-Ende-Sprache fasst die Stufen zusammen; Chroma 1.0 antwortet in unter 150 ms, Step-Audio-R1.1 erreicht erste Audioausgabe in etwa 1,51 Sekunden. Über das Erlebnis entscheiden der Sprecherwechsel, der antwortet oder weiter zuhört, und Werkzeugaufrufe, damit Sprache suchen und buchen kann. Der Maßstab verschiebt sich von menschlicher Stimme zur erledigten Aufgabe.