阿里通义千问发布 Qwen3.8-Flash,把低成本推理与下一代架构预览放进同一次更新。该模型采用多模态 MoE 路线,主模型为125B参数,每个Token仅激活6B;其Next版本更提前引入 Qwen4 架构设计,目标直指长上下文效率与单位推理成本。
125B模型,每次只激活6B
Qwen3.8-Flash-Next由125B参数主模型和额外51B N-gram Embedding组成。N-gram Embedding可根据局部上下文进行查表,在增加模型容量的同时,将额外计算量压到较低水平。
每个Token仅激活6B参数,是这款 MoE模型 的关键指标。官方称,其训练成本约为Qwen3.7-Plus的1/9,同时在编程和办公任务上取得能力提升,模型竞争开始从“规模更大”转向“每次调用更省”。
Qwen4架构提前露出
Qwen3.8-Flash-Next并非完整Qwen4,而是下一代架构的早期预览。Attention采用GDN与QSA混合设计:GDN压缩历史信息,QSA则筛选更重要的上下文,以降低长序列计算和KV Cache访问压力。
残差结构也升级为Gated Residual,并加入可卸载至Host Memory的N-gram Embedding。模型原生支持262,144 Token上下文,还可通过YaRN扩展至1M Token,长上下文效率成为这次架构调整的核心目标。
Flash瞄准规模化AI应用
生产版本Qwen3.8-Flash面向QwenCloud提供服务,默认支持1M上下文。这样的产品定位更适合 AI编程、文档处理、智能体和高频API调用,因为这些场景既需要长上下文,也对推理价格与吞吐高度敏感。
Qwen团队选择在完整Qwen4家族之前公开Next架构,本质上也是给开源生态预留适配期。推理框架、量化工具和部署方案可以提前围绕新结构调整,降低下一代模型正式发布时的迁移成本。
Qwen3.8-Flash透露出的方向很明确:下一轮大模型竞争不会只看参数和Benchmark,谁能用更少激活参数、更低内存开销处理更长上下文,谁才更容易进入真正高频的AI应用。