ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Informationen
Baseten-Test: Die von Claude geschriebene Inferenz-Engine ist 90 % schneller als vLLM

Baseten-Test: Die von Claude geschriebene Inferenz-Engine ist 90 % schneller als vLLM

KI-Informationen • Admin • • 20 Aufrufe

Kann eine Inferenz-Engine von einem KI-Agenten von Grund auf geschrieben werden und ein ausgereiftes Universal-Framework schlagen? Der am 2. Oktober 2026 aktualisierte Engineering-Blog von Baseten berichtet von genau einem solchen Test: In Anlehnung an das MetaInfer-Paper ließen die Ingenieure Claude Code (Fable 5) eine maßgeschneiderte Inferenz-Engine für Qwen-3.6-35B-A3B von Grund auf bauen, die mit NVFP4-Präzision auf einer einzelnen NVIDIA B200 läuft und den Namen VibeQwen erhielt. MetaInfer nutzt ein Skills-only-Framework und erfordert kein Nachtraining des Modells.

Die Kerndaten: 90 % schneller im Einzelstrom, Latenz bis zum ersten Token mehr als halbiert

VibeQwen erreichte im Single-Stream-Decoding 1792 TPS, gegenüber 943 TPS bei einem feinabgestimmten vLLM 0.25.1 – 90 % schneller. Die Latenz bis zum ersten Token betrug 12 ms gegenüber 28 ms, eine Verbesserung um den Faktor 2,33, und bei einer Parallelität von 32 lag der Ausgabedurchsatz bei 10307 TPS gegenüber 6030 TPS bei vLLM, also 71 % höher. Bemerkenswert: Die Vergleichsbasis war ein abgestimmtes vLLM, nicht die Standardkonfiguration.

Ziel war es, vLLM in allen Kennzahlen um 20 % zu schlagen, ohne Präzision einzubüßen; als Präzisionsmaßstab diente BF16. Claude arbeitete rund eine Woche weitgehend autonom, verbrauchte etwa 1,7 Milliarden Token (überwiegend zwischengespeicherte Eingaben) und rund 200 B200-Stunden und hatte vLLM bereits in den ersten Tagen eingeholt; bei geringfügigen numerischen Abweichungen in der Präzision war eine menschliche Freigabe nötig.

Das zweite Experiment Sammie: Wissensbasis wiederverwendet, schneller und günstiger

Baseten führte anschließend ein zweites Experiment durch, Sammie: Ein Agent baute einen Inferenzdienst für das Bildsegmentierungsmodell SAM 3.1 und erreichte auf einer einzelnen H100 91 Bilder pro Sekunde – 50 % mehr Durchsatz als der offizielle Referenzserver von Meta –, und das in nur wenigen Tagen mit etwa 200 Millionen Token. Schneller und günstiger war es, weil die im ersten Experiment aufgebaute Wissensbasis wiederverwendet wurde. Die Kosten reichten von wenigen hundert Dollar für Sammie bis zu wenigen tausend Dollar für VibeQwen. Diese Wiederverwendbarkeit von Erfahrung könnte wichtiger sein als jedes Einzelergebnis.

Grenzen und Voraussetzungen: noch experimentell, Präzisionsvorgabe muss vorab feststehen

Beide Engines sind nach wie vor experimentell und tragen keinen Produktivverkehr. Baseten weist zudem darauf hin, dass der Agent auf vorhandene Kernel von vLLM und TensorRT-LLM zugreifen durfte, statt wie im ursprünglichen Paper vollständig vom Quellcode isoliert zu sein. Solche automatische Optimierung beruht auf zwei Voraussetzungen: Inferenzkennzahlen sind quantifizierbar, und die Korrektheit lässt sich numerisch gegen eine Referenzimplementierung in voller Präzision prüfen – so erhält jede Verbesserung einen objektiven Maßstab. Und die Präzisionsvorgabe muss vorab festgeschrieben sein, sonst findet der Agent Schlupflöcher, etwa indem er immer dasselbe Zeichen ausgibt, um die Kennzahlen zu schönen.

Die Schwäche der Universal-Engines ist der Platz der Spezialoptimierung

vLLM, SGLang und TensorRT-LLM punkten mit Allgemeingültigkeit und einfacher Nutzung, doch für eine bestimmte Kombination aus Modell, Hardware und Last sind sie meist nicht optimal. Die Ausgaben für Inferenz sind enorm, und schon eine Verbesserung um wenige Prozentpunkte bedeutet im großen Maßstab Millionen von Dollar – genau dort hat eine spezialisierte Engine ihren Platz.

Empfohlene Tools

Mehr