ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
GLM-5.3-FlashX上线:最高200 tokens/s,智谱把大模型竞争推向Infra

GLM-5.3-FlashX上线:最高200 tokens/s,智谱把大模型竞争推向Infra

AI资讯 Admin 3 次浏览

智谱正式推出 GLM-5.3-FlashX,最高推理速度达到200 tokens/s,API同步开放,Model Key为GLM-5.3-FlashX。相比现有GLM-5.3-Flash,新版本速度提升至约5倍,价格则提高至2.5倍。AI模型的竞争,开始从“谁更聪明”进一步转向“谁能更快、更便宜地稳定输出”。

从Ox Alpha到FlashX

GLM-5.3-Flash此前曾以 Ox Alpha 匿名登陆OpenCode和OpenRouter。Z.ai披露,该模型上线一周内成为两大平台调用量最高的模型之一,6天处理超过62万亿tokens,高并发需求直接把压力推向推理基础设施。

与重新训练一个更大的模型相比,FlashX更像一次面向生产环境的“性能分层”:保持Flash系列的能力定位,同时把输出吞吐提高到200 tokens/s,让Coding Agent、实时对话和工具调用获得更短的等待时间。

10万张国产芯片撑起推理提速

速度背后并不只是增加机器。智谱称,GLM-5.3-Flash生产推理运行在超过10万张国产AI加速芯片组成的集群上,并针对显存、带宽和新模型架构重新搭建推理系统。

官方披露的优化包括W8A8量化、混合精度缓存、Layer Split以及Encode-Prefill-Decode解耦架构。经过多轮优化,同一硬件上的端到端Serving性能较初始版本提升约3倍。

大模型竞争进入Infra阶段

FlashX把速度单独做成更高价的API层级,本质上是在给“低延迟”定价。对企业而言,Agent每一步都要等待模型返回,tokens/s直接决定任务链路能否从几十秒压缩到可交互范围。

当模型能力差距逐渐缩小时,推理引擎、芯片适配、集群调度和单位token成本会成为新的护城河。GLM-5.3-FlashX的意义不只是一项200 tokens/s指标,更在于国产算力开始承接大规模真实调用,并把Infra优化直接转化成产品差异。

推荐工具

更多