2026 年 9 月 30 日,蚂蚁集团旗下 InclusionAI(百灵)通过官方公众号发布了新一代语言模型 Ling-3.1-flash:总参数 5600 亿、每次推理仅激活约 250 亿参数,主攻智能体任务、搜索、办公软件和专业应用场景。这是 flash 系列第一次把参数规模推到 5000 亿量级。
参数翻了近五倍,"flash"还在讲效率
上一代 Ling-3.0-flash 走的是"小而快"路线:总参数 1240 亿、激活参数 51 亿,靠混合注意力架构在 4 卡 Blackwell 上跑出单请求 606 tok/s 的吞吐,模型权重以 MIT 协议开源,被不少开发者拿去自部署。而 Ling-3.1-flash 直接把总参数拉到 5600 亿、激活 250 亿,规模接近上一代的五倍。
激活参数只占总参数的约二十分之一——这正是混合专家(MoE)架构的逻辑:模型里存着大量"专家"模块,每次推理只调用最相关的几个,知识容量和推理开销就此解耦。关于"参数很大、激活却没那么大"背后的具体原理,可以参考这篇解读:混合专家(MoE)是什么?为什么很多热门模型参数很大、激活却没那么大。
百万上下文是目标,试用期先给 25.6 万
按官方说法,Ling-3.1-flash 的设计目标是支持最高 100 万 token 的上下文窗口,面向"真实世界长任务"。但当前开放的两周免费试用里,上下文上限是 25.6 万 token;试用期结束后,官方计划放开更大的窗口,并将模型开源。
这个节奏延续了百灵一贯的做法:先免费试用、收集真实场景反馈,再决定开源。考虑到 Ling 系列此前多款模型都采用 MIT 协议开源,这次"试用后开源"的承诺可信度不低。
定位排序透露意图:从聊天转向"干活"
发布信息里最值得注意的是定位排序——智能体任务被放在第一位,其次是搜索、办公软件和专业应用。这意味着 Ling-3.1-flash 不是为通用聊天优化的模型,而是为"完成一项工作"这类长链条任务设计的:多轮工具调用、长文档处理、跨应用协作,正是这类场景最吃上下文长度和稳定性的地方。
长任务赛道:百灵想抢什么
从"小而快"到"大而全",百灵的产品转向其实呼应了整个行业的重心转移:2026 年的竞争早已不只是拼聊天质量,而是拼谁能让模型稳定地跑完一个真实任务。智能体场景里,模型需要在数十轮交互中保持目标一致、正确调用工具、处理超长输入——这正是大参数量加长上下文的组合要解决的问题。
对开发者来说,眼下最实际的动作是去薅这两周免费试用:25.6 万 token 的上下文足够验证大多数长任务流程,而试用结束后的开源版本如果延续 MIT 协议,意味着企业可以零授权成本自部署一个 5600 亿参数级的长任务模型——这在国产模型里是少有的。上一代模型的实测表现可参考:Ling 3.0 Flash 解码提速:四卡 Blackwell 单请求达到 606 tok/s。