Zhipu (Z.ai) a officiellement lancé et rendu open source le GLM-5.3-Flash (320B-A18B). C’est le premier modèle multimodal natif de la série GLM-5, prenant en charge des contextes de jetons 1M et ramenant les prix des API à une fraction de ceux des modèles phares. Plutôt que de simplement viser des spécifications plus importantes, cette version ressemble davantage à une offensive « rapport qualité/coût ».
320B, seulement 18B activé
GLM-5.3-Flash a un nombre total de paramètres de 320B, avec seulement 18B activés par inférence, réduisant la charge de calcul tout en conservant les capacités du modèle frontière. Le multimodal natif et le contexte 1M permettent au code, aux images et aux longues tâches d’entrer dans le même flux de travail de l’Agent.
Dans l’Indice d’Intelligence Analytique Artificielle, ce modèle a obtenu un score de 57, se classant dans le même palier que Claude Opus 4.8. Le Z.ai Code Bench auto-développé par Zhipu offre également des performances de programmation similaires, bien que ce dernier soit basé sur des standards de test fournis par les fournisseurs.
Ox Alpha révèle son identité
Avant sa sortie officielle, le modèle a été présenté anonymement sous le nom Ox Alpha sur OpenCode et OpenRouter. Zhipu affirme que ce trafic est entièrement alimenté par des puces IA chinoises ; Désormais, les poids des modèles sont ouverts sous licence MIT, permettant aux développeurs de les déployer eux-mêmes.
Des tests de résistance anonymes aux poids ouverts, cette approche a étendu les scénarios de validation de la puissance informatique nationale au-delà de l’entraînement des modèles, vers une inférence en ligne à grande échelle.
Le prix est plus agressif que les spécifications
L’API officielle offre 50 % de réduction pendant deux semaines : 0,075 $ d’entrée par million de tokens, 0,25 $ de sortie, et 0,015 $ d’entrée cache par million de tokens. La réduction couvre également les agrégateurs de modèles tiers, réduisant directement les coûts de la programmation IA et des appels d’agents à haute fréquence.
Selon les normes Zhipa, GLM-5.3-Flash est généralement proposé à environ un dixième de GLM-5.3, avec des périodes promotionnelles d’environ un vingtième, et le coût global peut être aussi bas que quarante-cinquième de celui de Claude Opus 4.8. Actuellement, le modèle est entré dans ZCode, Coding Plan, Chat et API.
Le point fort de GLM-5.3-Flash n’est pas seulement « Flash », mais aussi que les capacités de pointe, le contexte 1M, la pondération open source et les API à faible coût sont tous intégrés dans un seul modèle. Si cette structure de coûts peut être maintenue, la concurrence des modèles évoluera plus rapidement de « qui est le plus fort » à « qui peut étendre les capacités fortes ».