ToolNavs KI-Tool-Verzeichnis
Tool einreichen Anmelden
Zurück zu KI-Informationen
Das Open-Source-Zhipu-Modell GLM-5.3-Flash, das 320B-Modell, hat die KI-Preise auf neue Tiefs getrieben

Das Open-Source-Zhipu-Modell GLM-5.3-Flash, das 320B-Modell, hat die KI-Preise auf neue Tiefs getrieben

KI-Informationen Admin 4 Aufrufe

Zhipu (Z.ai) brachte offiziell den GLM-5.3-Flash (320B-A18B) auf den Markt und machte ihn als Open-Source. Es ist das erste native multimodale Modell der GLM-5-Serie, unterstützt 1M Token-Kontexte und senkt die API-Preise auf nur einen Bruchteil der Flaggschiffmodelle. Anstatt einfach größere Spezifikationen zu verfolgen, fühlt sich diese Veröffentlichung eher wie eine "Fähigkeit/Kosten-Verhältnis"-Offensive an.

320B Parameter, nur 18B aktiviert

GLM-5.3-Flash hat eine Gesamtparameteranzahl von 320 B, wobei pro Inferenz nur 18 B aktiviert werden, was die Rechenlast reduziert und gleichzeitig die Frontier-Modell-Fähigkeiten beibehält. Native multimodaler und 1M-Kontext ermöglichen Code, Bilder und lange Aufgaben, dass sie in denselben Agenten-Workflow gelangen.

Im Artificial Analysis Intelligence Index erreichte dieses Modell eine Punktzahl von 57 und liegt damit in derselben Stufe wie Claude Opus 4,8. Zhipus selbst entwickeltes Z.ai Code Bench liefert ebenfalls eine ähnliche Programmierleistung, wobei letzteres auf Hersteller-Teststandards basiert.

Ox Alpha offenbart seine Identität

Vor seiner offiziellen Veröffentlichung wurde das Modell anonym unter dem Namen Ox Alpha auf OpenCode und OpenRouter vorgestellt. Zhipu behauptet, dass dieser Datenverkehr vollständig von chinesischen KI-Chips gesteuert wird; Jetzt sind Modellgewichte unter der MIT-Lizenz offen, sodass Entwickler sie selbst bereitstellen können.

Von anonymen Stresstests bis hin zu offenen Gewichten hat dieser Ansatz die Validierungsszenarien der inländischen Rechenleistung über das Modelltraining hinaus auf groß angelegte Online-Inferenz erweitert.

Der Preis ist aggressiver als die Spezifikationen

Die offizielle API ist für zwei Wochen 50 % reduziert: 0,075 $ Eingabe pro Million Tokens, 0,25 $ Ausgabe und 0,015 $ Cache-Eingabe pro Million Tokens. Der Rabatt deckt auch Drittanbieter-Modellaggregatoren ab und senkt damit direkt die Kosten für KI-Programmierung und hochfrequente Agentenanrufe.

Nach Zhipa-Standards kostet GLM-5.3-Flash typischerweise etwa ein Zehntel von GLM-5.3, die Werbefristen etwa ein Zwanzigstel, und der Gesamtpreis kann so niedrig wie ein Vierzigfünftel von Claude Opus 4.8 betragen. Derzeit befindet sich das Modell in ZCode, Coding Plan, Chat und API.

Das Highlight von GLM-5.3-Flash ist nicht nur "Flash", sondern auch, dass modernste Funktionen, 1M-Kontext, Open-Source-Gewichtung und kostengünstige APIs in einem Modell integriert sind. Wenn diese Kostenstruktur aufrechterhalten werden kann, wird der Modellwettbewerb schneller von "wer ist am stärksten" zu "wer kann starke Fähigkeiten skalieren" verschieben.

Empfohlene Tools

Mehr