智谱正式推出 GLM-5.3-FlashX,最高推理速度达到200 tokens/s,API同步开放,Model Key为GLM-5.3-FlashX。相比现有GLM-5.3-Flash,新版本速度提升至约5倍,价格则提高至2.5倍。AI模型的竞争,开始从“谁更聪明”进一步转向“谁能更快、更便宜地稳定输出”。
从Ox Alpha到FlashX
GLM-5.3-Flash此前曾以 Ox Alpha 匿名登陆OpenCode和OpenRouter。Z.ai披露,该模型上线一周内成为两大平台调用量最高的模型之一,6天处理超过62万亿tokens,高并发需求直接把压力推向推理基础设施。
与重新训练一个更大的模型相比,FlashX更像一次面向生产环境的“性能分层”:保持Flash系列的能力定位,同时把输出吞吐提高到200 tokens/s,让Coding Agent、实时对话和工具调用获得更短的等待时间。
10万张国产芯片撑起推理提速
速度背后并不只是增加机器。智谱称,GLM-5.3-Flash生产推理运行在超过10万张国产AI加速芯片组成的集群上,并针对显存、带宽和新模型架构重新搭建推理系统。
官方披露的优化包括W8A8量化、混合精度缓存、Layer Split以及Encode-Prefill-Decode解耦架构。经过多轮优化,同一硬件上的端到端Serving性能较初始版本提升约3倍。
大模型竞争进入Infra阶段
FlashX把速度单独做成更高价的API层级,本质上是在给“低延迟”定价。对企业而言,Agent每一步都要等待模型返回,tokens/s直接决定任务链路能否从几十秒压缩到可交互范围。
当模型能力差距逐渐缩小时,推理引擎、芯片适配、集群调度和单位token成本会成为新的护城河。GLM-5.3-FlashX的意义不只是一项200 tokens/s指标,更在于国产算力开始承接大规模真实调用,并把Infra优化直接转化成产品差异。