ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
NaiveAI 开源 309B 模型 N0.5-Flash:去掉全部全注意力层,原生 100 万上下文

NaiveAI 开源 309B 模型 N0.5-Flash:去掉全部全注意力层,原生 100 万上下文

AI资讯 • Admin • • 9 次浏览

NaiveAI 在 2026 年 9 月 27 日发布了开源权重模型 Naive-N0.5-Flash:总参数 309B、每 token 只激活 15.5B 的混合专家(MoE)模型,原生支持 100 万 token 上下文,权重以 MIT 许可证在 Hugging Face 公开。这是"无全注意力层"路线迄今最大胆的一次工程验证——整座 48 层网络里,没有任何一层使用传统全注意力。

全栈 48 层,没有一层是全注意力

模型把 48 层 Transformer 切成 8 个六层模块,每个模块配 5 层滑动窗口注意力加 1 层轻量版 DeepSeek 稀疏注意力(DeepSeek Sparse Attention),合计 39 层滑动窗口、9 层稀疏层。滑动窗口只有 128 token,稀疏层每次为骨干注意力挑选最重要的 2048 个 token,配合 4 组 KV 的分组查询注意力。官方模型卡的描述很直白:全网保持局部或稀疏,没有全注意力层,也能做到原生 100 万上下文。

3.25T token 训练,基座来自小米开源模型

训练一共用了 3.25T token,全部在原生 100 万上下文长度下进行:先用 50B token 把稀疏索引器预热,再用 3T token 做稀疏注意力训练,最后 200B token 衰减学习率。基座来自小米的开源权重模型 MiMo-V2.5——此前本站介绍过小米开源的 MiMo-V2.6,同属一个模型家族的延续;致谢名单里还出现了 DeepSeek 稀疏注意力设计团队和 SGLang 推理框架。小米随后公布的 MiMo-V3 核心架构 HySparse2 也在走稀疏化路线,"去掉全注意力"正在成为国产开源模型的一条显性趋势。

"用 AI 造 AI":研发管线本身也是卖点

比参数更值得看的是它的研发方式。NaiveAI 在随附的技术博客里写道,这次的研发与工程管线"大部分由 AI 系统实质执行":模型自己写代码、跑实验、监控结果并提出下一轮迭代,人类研究员负责定目标、定约束、定评测标准,做关键决策。技术报告的标题就叫《Naive-N0.5-Flash: Building Frontier AI with AI》。NaiveAI 今年 2 月由清华教授戴继峰在北京创立,成立仅七个月,这篇模型某种程度上是它"AI 研发 AI"方法论的第一份答卷。

速度数字很漂亮,但都是自报家门

随模型一起发布的还有自研推理栈 NaiveRT:大核融合、程序化依赖启动、推测解码加 FP8 混合精度。官方宣称标准模式下每用户 50 token/秒,极速模式可达 2000 token/秒。独立评测方已经提醒:这是窄口径的解码速度数字,不是端到端实测,长上下文下的精度保持同样待验证。托管 API 定价每百万 token 输入 0.1 美元、输出 0.4 美元,缓存读取 0.01 美元,目标场景明确写着编程与 AI 研发。

这件事为什么值得关注,有两层。第一,它把"稀疏注意力能否彻底替代全注意力"从论文争论变成了可以下载验证的工程事实:如果 100 万上下文真能在无全注意力层的情况下跑稳,会直接改写长上下文模型的成本账。第二,MIT 许可证意味着商用无门槛,309B 总参、15.5B 激活的配比让实际部署成本接近中型稠密模型,对做代码智能体和长文档 RAG 的团队是个新选项。冷静的一面是:所有漂亮数字目前都是公司自报,真实表现要等社区实测——而开源权重的意义恰恰在这里,质疑可以直接跑一遍验证。

推荐工具

更多