智谱(Z.ai)正式上线并开源 GLM-5.3-Flash(320B-A18B)。它是GLM-5系列首个原生多模态模型,支持1M token上下文,并把API价格压到旗舰模型的零头。相比单纯追求更大参数,这次发布更像一次“能力/成本比”攻势。
320B参数,只激活18B
GLM-5.3-Flash总参数量320B,每次推理仅激活18B,在保留前沿模型能力的同时降低计算压力。原生多模态与1M上下文,则让代码、图像和长任务可以进入同一套Agent工作流。
在Artificial Analysis Intelligence Index中,该模型取得57分,与Claude Opus 4.8处于同一档。智谱自研Z.ai Code Bench也给出相近的编程表现,不过后者属于厂商自测口径。
Ox Alpha揭开身份
正式发布前,模型曾以 Ox Alpha 名义在OpenCode、OpenRouter匿名预览。智谱称,这批流量完全由中国AI芯片承载;如今模型权重以MIT许可证开放,开发者可自行部署。
从匿名压测再到开放权重,这条路线也让国产算力的验证场景从模型训练进一步延伸至大规模在线推理。
价格比参数更有攻击性
官方API限时两周打五折:每百万token输入0.075美元、输出0.25美元、缓存输入0.015美元。折扣还覆盖第三方模型聚合商,直接降低AI编程与智能体高频调用成本。
按智谱口径,GLM-5.3-Flash常规定价约为GLM-5.3的1/10,促销期约为1/20,综合成本可低至Claude Opus 4.8的1/40。目前模型已进入ZCode、Coding Plan、Chat与API。
GLM-5.3-Flash的看点不只是“Flash”,而是前沿能力、1M上下文、开源权重与低价API被放进同一个模型。如果这种成本结构能够持续,模型竞争会更快从“谁最强”转向“谁能把强能力规模化用起来”。