ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Informationen
GLM-5.3-FlashX-Start: Bis zu 200 Token/s, Zhipu drängt den Wettbewerb großer Modelle in die Infra

GLM-5.3-FlashX-Start: Bis zu 200 Token/s, Zhipu drängt den Wettbewerb großer Modelle in die Infra

KI-Informationen Admin 1 Aufrufe

Zhipu brachte offiziell GLM-5.3-FlashX auf den Markt, mit einer maximalen Inferenzgeschwindigkeit von 200 Token/s, API-gleichzeitiger Öffnung und Modellschlüssel GLM-5.3-FlashX. Im Vergleich zum bestehenden GLM-5.3-Flash ist die neue Version etwa fünfmal schneller, mit einer Preiserhöhung um das 2,5-fache. Der Wettbewerb unter den KI-Modellen hat sich von "wer ist klüger" zu "wer stabil schneller und günstiger produzieren kann" verschoben.

Von Ox Alpha zu FlashX

GLM-5.3-Flash hatte sich zuvor anonym als Ox Alpha in OpenCode und OpenRouter eingeloggt. Z.ai enthüllte, dass das Modell innerhalb einer Woche nach dem Start eines der am häufigsten genutzten Modelle auf den beiden Hauptplattformen wurde und in sechs Tagen über 62 Billionen Token verarbeitete, wobei hohe Nebenzeitanforderungen direkt Druck auf die Inferenzinfrastruktur ausübten.

Im Vergleich zum Umtrainieren eines größeren Modells ähnelt FlashX eher einer Produktions-"Performance Layering": Die Fähigkeitspositionierung der Flash-Serie wird beibehalten, während der Output-Durchsatz auf 200 Token/s erhöht wird, wodurch Coding Agents, Echtzeitgespräche und Tool-Calls ermöglicht werden, um die Wartezeiten zu verkürzen.

100.000 inländische Chips unterstützen schnellere Inferenz

Geschwindigkeit bedeutet nicht nur, die Maschinen zu erhöhen. Zhipu erklärt, dass die GLM-5.3-Flash-Produktionsinferenz auf einem Cluster von über 100.000 im Inland hergestellten KI-Beschleunigerchips läuft und das Inferenzsystem für Speicher, Bandbreite und neue Modellarchitekturen neu aufgebaut wird.

Offizielle Optimierungen umfassen W8A8-Quantisierung, Mixed-Precision-Cache, Layer Split und die Entkopplungsarchitektur Encode-Prefill-Decode. Nach mehreren Optimierungsrunden ist die End-to-End-Bereitstellung auf derselben Hardware etwa dreimal so hoch wie in der ursprünglichen Version.

Der große Modellwettbewerb ist in die Infrastrukturphase eingetreten

FlashX macht Geschwindigkeit zu einer teureren API-Stufe und bepreist sie im Grunde nach "niedriger Latenz". Für Unternehmen muss jeder Schritt eines Agenten auf die Rückkehr des Modells warten, und Token/Tokens bestimmen direkt, ob die Aufgabenkette von mehreren zehn Sekunden auf einen interagierbaren Bereich komprimiert werden kann.

Wenn die Lücke in der Modellkapazität kleiner wird, werden Inferenz-Engines, Chipanpassung, Cluster-Planung und Kosten-pro-Stück-Token zu neuen Gräben werden. Die Bedeutung von GLM-5.3-FlashX liegt nicht nur in einer 200-Tokens/s-Metrik, sondern vor allem darin, dass die inländische Rechenleistung beginnt, groß angelegte reale Anrufe durchzuführen und Infra-Optimierung direkt in Produktdifferenzierung zu übersetzen.

Empfohlene Tools

Mehr