ToolNavs KI-Tool-Verzeichnis
Tool einreichen Anmelden
Zurück zu KI-Enzyklopädie
Was ist spekulatives Dekodieren? Warum können kleine Modelle zuerst Entwürfe schreiben, wodurch große Modelle schneller werden?

Was ist spekulatives Dekodieren? Warum können kleine Modelle zuerst Entwürfe schreiben, wodurch große Modelle schneller werden?

KI-Enzyklopädie Admin 2 Aufrufe

Spekulative Dekodierung ist eine Methode zur Inferenzbeschleunigung für große Modelle: Zuerst schlägt ein leichteres, schnelleres Entwurfmodell mehrere Kandidatentoken hintereinander vor, dann führt das große Zielmodell eine parallele Prüfung durch. Wenn ein Kandidat akzeptiert wird, kann das Zielmodell mehrere Positionen in einer einzigen Vorwärtsberechnung vorrücken; Alle unqualifizierten Teile werden vom Zielmodell korrigiert. Es optimiert die Wartezeit bei der Erzeugung, nicht einfach das Zusammenfügen von Antworten aus zwei Modellen.

Jeder Token erzeugt die Verlangsamung

Autoregressive Modelle müssen in der Regel als erster Token gebildet werden, bevor der zweite fortgesetzt werden kann. Selbst bei hoher GPU-Rechenleistung führt diese serielle Abhängigkeit zu häufigen Kurzzeitberechnungen beim Dekodieren, und die Hardware wird möglicherweise nicht vollständig ausgelastet. Es wird spekuliert, dass das Dekodieren der ersten Entwürfe einen möglichen Folgeinhalt erstellt und ihn dann großen Modellen zur Batch-Bewertung vorlegt, wodurch die Anzahl der Aufrufe zum Zielmodell reduziert wird.

Der Prozess kann in vier Schritte verstanden werden:

  1. Das Entwurfsmodell schlägt eine kurze Sequenz von Kandidatensequenzen basierend auf dem aktuellen Kontext vor.
  2. Das Zielmodell berechnet die Wahrscheinlichkeiten dieser Positionen parallel.
  3. Kandidaten werden gemäß den Annahmeregeln gehalten, und wenn eine Stelle nicht passt, endet die Aufnahme.
  4. Das Zielmodell ergänzt die richtigen Zweige, bevor mit der nächsten Draft-Runde begonnen wird.

Standardalgorithmen verwenden unterstützende Akzeptanz- und Korrekturregeln, sodass sie die ursprüngliche Stichprobenverteilung des Zielmodells beibehalten können; Sie ersetzen große Modelle nicht heimlich durch kleine Modelle, noch erfordert sie ein Neutraining des Zielmodells.

Warum ist es nicht immer schneller?

Die wichtigste Kennzahl ist die Kandidatenakzeptanzrate. Wenn das Entwurfsmodell zu schwach ist, wird es oft innerhalb der ersten Token abgelehnt, und zusätzliche Entwürfe werden zu einem Overhead; Ist das Entwurfsmodell zu groß, verliert es die Bedeutung von "billiger Generierung". Textvorhersehbarkeit, Kandidatenlänge pro Runde, Hardware-Parallelität und Batch-Größe beeinflussen alle den Umsatz. Inhalte mit starker Kontinuität, wie Code und feste Formate, akzeptieren in der Regel eher längere Entwürfe als stark divergente Erstellungen.

Sie unterscheidet sich von anderen Beschleunigungsmethoden, die Probleme lösen

Quantisierung reduziert hauptsächlich die Gewichtsgröße und die Rechenkosten, während KV Cache berechnete historische Aufmerksamkeitszustände wiederverwendet; Spekulative Dekodierung konzentriert sich darauf, wie ein einzelnes Zielmodell mehr Tokens bestätigen kann. Diese Methoden können kombiniert werden, benötigen aber zusammen Speicher und erhöhen die Planungskomplexität.

Um festzustellen, ob es sich lohnt, es zu übernehmen, sollten Sie nicht nur auf die Geschwindigkeit in der Demo schauen. Deployment-Teams sollten ihre Prompt-Länge, Ausgabe-Länge, Nebenläufigkeitsvolumen und Hardware für den ersten Token-Zeitpunkt, die Pro-Token-Latenz, den Durchsatz und den Speicherverbrauch vergleichen und sicherstellen, dass die Beschleunigung nicht auf Kosten einer geringeren Stabilität geht.

Empfohlene Tools

Mehr