LLM-Inferenzoptimierung
Schon eine andere Reihenfolge beim Batching verändert den Durchsatz derselben Karte um ein Vielfaches. Hier steht, welchen Abschnitt Continuous Batching, Speculative Decoding, KV-Cache und Context Caching jeweils einsparen und wie weit Kernel-Bibliotheken und sparse Architekturen kommen.
Continuous Batching verkleinert die Planung auf einen Generierungsschritt; spekulatives Dekodieren lässt ein kleines Modell entwerfen, während das große einen Block in einem Durchgang prüft. Der KV-Cache nutzt Aufmerksamkeitszustände weiter, Context Caching hält Ergebnisse langer Dokumente. MoE aktiviert pro Token wenige Experten, Kimi Linear senkt den KV-Cache bei einer Million Kontext um rund 75 Prozent. Der Gewinn hängt am Workload: Code nimmt lange Entwürfe an, freies Schreiben oft nicht.