ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Enzyklopädie
Was ist Autoregression? Warum große Modelle Text Token für Token ausgeben

Was ist Autoregression? Warum große Modelle Text Token für Token ausgeben

KI-Enzyklopädie • Admin • • 6 Aufrufe

Autoregression ist das grundlegende Verfahren, mit dem ein großes Modell Text erzeugt: Aus den bereits vorhandenen Token sagt es das wahrscheinlichste nächste Token voraus, hängt dieses neue Token ans Ende der Eingabe an, sagt das nächste voraus und wiederholt diesen Kreislauf, bis ein Endzeichen ausgegeben wird oder eine Längengrenze erreicht ist. Wenn Sie im Chat sehen, wie eine Antwort Wort für Wort herausploppt, sehen Sie die äußere Form dieser schrittweisen Dekodierung, keinen zusätzlich erzeugten Effekt.

Token für Token nach vorn

Ein Token lässt sich grob als die Texteinheit in den Augen des Modells verstehen: Es kann ein Zeichen, ein Teil eines Wortes oder eine Kombination mit Satzzeichen sein. In jedem Schritt steht das Modell vor dem gesamten bisherigen Kontext, und es hat nur ein Urteil zu fällen: Welches Token ist als nächstes am wahrscheinlichsten? Ist es gewählt, wächst der Kontext um genau dieses Stück, und das nächste Urteil baut auf dem längeren neuen Kontext auf. Ändert man weiter vorn auch nur ein Wort, kann sich der spätere Verlauf verschieben, weil jeder Schritt auf allen zuvor getroffenen Entscheidungen ruht.

Beim Training liegt der ganze Text vor, beim Erzeugen geht es nur vorwärts

Training und Erzeugung sind zwei verschiedene Dinge. Beim Training liegt der vollständige Originaltext bereits vor, das Modell kann einen ganzen Satz auf einmal sehen und parallel üben, welches Token an jeder Position als nächstes kommen sollte, wie beim Lernen mit Blick auf die Lösung. Beim Erzeugen gibt es keinen fertigen Fortgang zum Nachschauen: Das Modell kann nur ein Token erzeugen, es anhängen und das nächste erzeugen, die Arbeit muss also seriell ablaufen. Das ist der Hauptgrund, warum lange Antworten langsam sind. Es liegt nicht einfach daran, dass die Maschine nicht schnell genug wäre; dieses Verfahren kann spätere Token strukturell nicht vorab berechnen, weil es warten muss, bis frühere Ergebnisse feststehen.

Eingabe geht auf einmal, Ausgabe nur Schritt für Schritt

Wenn Sie eine Frage stellen, kann ein langer eingegebener Text vom Modell in einem Zug gelesen und parallel verarbeitet werden, sodass eine lange Eingabe die Wartezeit in der Regel nicht proportional zu ihrer Länge vervielfacht. Eine Antwort ist anders. So viele Token die Ausgabe enthält, so viele Dekodierschritte braucht sie, und jeder Schritt verlangt eine neue Berechnung. Je länger die Antwort, desto mehr Schritte und desto länger dauert es naturgemäß. Das erklärt auch, warum bei derselben Frage eine kurze Antwort schnell zurückkommt, während man bei einer langen warten muss, bis sie sich ausschreibt: Der Engpass liegt meist auf der Ausgabeseite, nicht auf der Eingabeseite.

Nicht jedes generative Modell arbeitet so, und drei Missverständnisse gehören getrennt

Autoregression ist nur die Wahl der heutigen gängigen Chatmodelle, nicht der einzige Weg, Inhalte zu erzeugen. Diffusionsbasierte Textmodelle gehen von einem unscharfen Zustand aus, entfernen schrittweise das Rauschen und überarbeiten das Ganze, während maskierte Modelle wie ein Lückentext arbeiten, also einen Teil des Inhalts erst verdecken und dann ergänzen; keines von beiden presst Token von links nach rechts einzeln heraus. Drei Missverständnisse sind verbreitet. Erstens die Annahme, das Modell denke den ganzen Absatz erst fertig und tippe ihn dann ab; in Wirklichkeit gibt es keinen globalen fertigen Entwurf, späterer Text wird immer vom früheren beeinflusst, was einer der Gründe ist, warum es beim Schreiben immer weiter abdriften kann. Zweitens die Annahme, die wortweise Ausgabe sei ein absichtlich erzeugter Tippeffekt; in Wirklichkeit zeigt die Streaming-Darstellung in der Oberfläche den Dekodiervorgang nur synchron an. Drittens die Annahme, Sampling sei selbst ein anderes Erzeugungsverfahren; Parameter wie die Temperatur beeinflussen nur, welches Kandidaten-Token in jedem Schritt ausgewählt wird, und ändern nichts am autoregressiven Kreislauf selbst.

Empfohlene Tools

Mehr