GLM-5.3-FlashX
Ce que GLM-5.3-FlashX change vraiment : comment le débit atteint 200 tokens par seconde sans déplacer le positionnement de capacités, ce que signifie facturer la faible latence comme un palier à part, et le travail d’inférence derrière.
GLM-5.3-FlashX est un palier de performance conçu pour la production, bâti sur GLM-5.3-Flash : même positionnement de capacités, mais un débit de sortie porté à 200 tokens par seconde, environ cinq fois plus rapide que la version précédente pour un prix 2,5 fois supérieur. La faible latence devient un palier tarifaire à part, et les agents de codage comme les dialogues en temps réel attendent moins. L’inférence tourne sur un cluster de plus de cent mille accélérateurs fabriqués en Chine.