ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Informations sur l’IA
GLM-5.3-FlashX lancement : jusqu’à 200 tokens/s, Zhipu pousse la concurrence des grands modèles dans l’Infrastructure

GLM-5.3-FlashX lancement : jusqu’à 200 tokens/s, Zhipu pousse la concurrence des grands modèles dans l’Infrastructure

Informations sur l’IA Admin 3 vues

Zhipu a officiellement lancé GLM-5.3-FlashX, avec une vitesse d’inférence maximale de 200 jetons/s, une ouverture simultanée de l’API et une clé modèle GLM-5.3-FlashX. Comparée au GLM-5.3-Flash existant, la nouvelle version est environ 5 fois plus rapide, avec une augmentation de prix de 2,5 fois. La concurrence entre les modèles d’IA est passée de « qui est le plus intelligent » à « qui peut produire de manière stable, plus rapide et moins coûteuse ».

D’Ox Alpha à FlashX

GLM-5.3-Flash s’était auparavant connecté anonymement à OpenCode et OpenRouter sous le nom d’Ox Alpha . Z.ai a révélé que, dans la semaine suivant le lancement, le modèle est devenu l’un des modèles les plus fréquemment consultés sur les deux grandes plateformes, traitant plus de 62 000 milliards de jetons en six jours, avec des exigences de concurrence élevées exerçant directement une pression sur l’infrastructure d’inférence.

Comparé à la rééducation d’un modèle plus grand, FlashX ressemble davantage à un « superposition de performance » en production : maintenir le positionnement des capacités de la série Flash tout en augmentant le débit de sortie à 200 jetons/s, en activant des agents de codage, des conversations en temps réel et des appels d’outils pour obtenir des temps d’attente plus courts.

100 000 puces domestiques supportent une inférence plus rapide

La vitesse ne consiste pas seulement à augmenter les machines. Zhipu affirme que l’inférence de production GLM-5.3-Flash fonctionne sur un cluster de plus de 100 000 puces accélératrices IA produites localement, et que le système d’inférence est reconstruit pour la mémoire, la bande passante et de nouvelles architectures de modèles.

Les optimisations officielles incluent la quantification W8A8, le cache à précision mixte, la division des couches et l’architecture de découplage Encode-Prefill-Decode. Après plusieurs cycles d’optimisation, la performance de service de bout en bout sur le même matériel est environ trois fois supérieure à celle de la version initiale.

Le grand concours de modèles miniatures est entré dans la phase infrastructure

FlashX fait de la vitesse un niveau API plus cher, en la fixant essentiellement pour une « faible latence ». Pour les entreprises, chaque étape qu’un agent entreprend doit attendre le retour du modèle, et les jetons déterminent directement si la chaîne de tâches peut être compressée de plusieurs dizaines de secondes à une plage interactionnelle.

À mesure que l’écart de capacité des modèles se réduit, les moteurs d’inférence, l’adaptation des puces, la planification des clusters et le token coût par unité deviendront de nouveaux douves. L’importance de GLM-5.3-FlashX ne réside pas seulement dans une métrique de 200 tokens/s, mais surtout que la puissance de calcul domestique commence à effectuer des appels réels à grande échelle et à traduire directement l’optimisation Infra en différenciation produit.

Outils Recommandés

Plus