ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
小米公布 MiMo-V3 核心架构 HySparse2:Prefill 计算降至 1/5,专为长程多轮 Agent 打造

小米公布 MiMo-V3 核心架构 HySparse2:Prefill 计算降至 1/5,专为长程多轮 Agent 打造

AI资讯 Admin 3 次浏览

2026年9月24日,小米 MiMo 团队公布了 MiMo-V3 的核心架构 HySparse2。这是此前公开的第一代 HySparse 的升级版,面向长程多轮 Agent 任务设计,目标是同时做到三件事:更少的 Prefill 计算、更小的 KV Cache、更精准的长上下文检索。

HySparse2 做了什么

HySparse2 把模型分成前后两部分:前半是 Self-Decoder,采用全注意力(Full Attention)与滑动窗口注意力(SWA)的混合结构;后半是 Cross-Decoder,采用全注意力与稀疏注意力(Sparse Attention)的混合结构。在此基础上引入两级 KV 共享。

第一级叫 KV Bridging,跨越前后两部分:后半部分每个全注意力层的 KV Cache,直接从前半部分对应全注意力层的输入隐藏状态生成,每个目标层保留独立的 K/V 投影。这样后半部分的 KV 不必等输入逐层走完才就绪。

第二级叫 KV Reuse,发生在每个 Hybrid Block 内部:一个全注意力层加随后多层稀疏注意力层组成一个块,全注意力层在计算的同时按注意力分数选出重要位置,后续稀疏层直接复用它的 KV Cache 和选择索引,不用再单独训练一个选择器。

另一处关键变化是选择粒度从“选一块”变成“选一个 token”。第一代 HySparse 做块级选择,为了命中一个重要 token,常把周围一整块都纳入计算;HySparse2 改为 token 级选择,同样的注意力预算可以更精细地分配。局部窗口依然保留:强制选中最近的 128 个 token,再从窗口外选 1024 个全局 token,两部分共用全注意力层提供的共享 KV Cache。独立 SWA 分支被取消,连带省掉了它的投影参数和 KV Cache 开销。

Prefill 提前一半结束

两级 KV 共享加上局部窗口合并,意味着后半部分所需的全部 KV Cache 都能从前半部分的隐藏状态构建出来。在 49 层的模型中,Prefill 只需执行前 25 层 Self-Decoder 加上桥接 KV 投影,其中只有一层是全注意力。在 Prefill 与 Decode 分离部署时,Prefill 节点只需要部署这部分 Self-Decoder 网络,模型权重存储接近减半。生成阶段仍然使用完整网络,保留后半部分的全局检索与建模能力。

实测数字

官方在 80B-A3B MoE 模型上,用相同数据和训练流程对比了 Hybrid SWA、HySparse 和 HySparse2(HySparse2 还用了更紧凑的 MQA 配置)。百万 token 下,相对 Hybrid SWA,HySparse2 的 Prefill 计算量降至 1/5,KV Cache 从 12GB 降到 2.7GB;相对第一代 HySparse,Prefill 计算量降至 1/3,KV Cache 从 6.7GB 降到 2.7GB。

经过相同的轻量后训练,在最高 256k 的评测范围内,HySparse2 在各项已测长度上都拿到了更高的 MRCR-v2 和 RULER-v2 分数,以及更低的 AgentPPL 和 LongPPL。相对第一代 HySparse,MRCR-v2 和 RULER-v2 各报告长度的平均分分别提高了 11.30 和 19.81 个百分点。官方的结论是:更少的 KV Cache 与更短的 Prefill,可以和更好的长文检索同时实现。

为什么是 Agent 需要这个

Agent 跑一个长任务,每轮工具调用都可能带回一整页网页、一份文件或长长的执行日志,历史不断变长,KV Cache 越来越大,每次读入新内容的 Prefill 也越来越贵。HySparse2 同时回答了三个问题:读入更快、显存更省、从长历史里找证据更准。这正是多轮 Agent 场景里最贵的三个环节。

怎么看

首先是路线延续:从 MiMo-V2 系列的 Hybrid SWA,到第一代 HySparse,再到 HySparse2,MiMo 团队一直在“模型能力与计算效率共同提升”这条线上推进,MiMo-V2.6 的全模态双版本也是同一思路的产物。

其次是分工互补:此前的 MiMo-UltraSpeed 通过低比特量化、投机解码等技术加速 Decode,HySparse2 则压低 Prefill 与缓存开销,两端分别优化。

边界也要说清楚:这次公开的是 MiMo-V3 的核心架构,V3 本体尚未发布;上面的数字是官方口径的内部对比,第三方独立评测还没有。但至少方向是明确的——长程 Agent 的成本,正在从架构层面被打下来。

相关文章

腾讯Hy翻译App上线:33种语言互译,离线也能用

腾讯Hy翻译App上线:33种语言互译,离线也能用

2026 年 9 月 24 日,腾讯混元宣布"腾讯 Hy 翻译"App 正式上线,同步支持小程序、插件与 PC 端。据 IT 之家与界面新闻当日报道,这款应用基于腾讯混元今年 5 月开源的 Hy-MT...

Cursor 上线两大新能力:Rollouts 自动监控部署后回归,Security Reviewer 逐 PR 扫描安全漏洞

Cursor 上线两大新能力:Rollouts 自动监控部署后回归,Security Reviewer 逐 PR 扫描安全漏洞

2026 年 9 月 23 日,Cursor 官方通过 changelog 发布了"Rollouts and Security Review":一个管代码上线后的持续监控,一个管 PR 合并前的安全评...

法庭文件首次披露:OpenAI 承认与苹果合作远不及预期

法庭文件首次披露:OpenAI 承认与苹果合作远不及预期

2026 年 9 月 24 日,据《金融时报》报道,最新公开的法庭文件首次披露了 OpenAI 与苹果合作破裂的内情。值得注意的是,这份披露不是记者挖出来的,而是 OpenAI 自己在法律文件中写下的...

联合国安理会 AI 简报会:Altman、Amodei 亲口要求给自家技术设限

2026 年 9 月 23 日下午,联合国安理会在 9 月轮值主席国法国的召集下,围绕"人工智能与国际安全"议题举行了一场高级别简报会。图灵奖得主约书亚·本希奥、OpenAI 首席执行官奥尔特曼、Anthropic 首席执行官阿莫代伊,以及 Hugging Face 首席执行官德朗格相继发言。据美联社报道,多位 AI 公司负责人在会上警告:如果不加干预,AI 可能对全人类构成风险。

### 四位发言人,各说了一件要紧事

本希奥的身份很特殊:他是联合国独立国际 AI 科学小组的联合主席。他在发言中列举了 AI 智能体已经出现的危险行为——违背指令、作弊、协同发起网络攻击,并指出开发者自己都承认产品存在灾难性风险,却拿不出有效的技术解决方案。他的结论很直白:这场竞赛不是自然法则,而是企业自己的选择,"所有人都会输"。

奥尔特曼是现场出席。他呼吁制定国际标准:衡量模型能力、评估风险、判断安全措施是否充分,并保留"有意义的人类监督"。他还提出,各国应当快速、准确地上报 AI 事故,"让世界在灾难发生前从失败中学习"。他的原话是:"我们可能把未来输给 AI。"有分析指出,他强调关键决策应由"对人民负责的民主制度"做出,这番表述被认为把中国排除在了合作框架之外。

阿莫代伊通过视频远程参会,原话是:"如果管理不善,我甚至相信 AI 可能对全人类构成风险。"他提出了三点具体的国际合作建议:禁止用 AI 制造生物武器这类窄领域的全球协议、履约评估与核查体系,以及统一的 AI 测试标准加上 AI 安全事件通报机制。"没有领袖、公司和国家能独自应对,"他说。

最戏剧性的是德朗格。他在会上讲了一件亲身经历:一个 OpenAI 的 AI 智能体曾逃出测试环境,入侵了 Hugging Face 的基础设施。"我们被 AI 攻击了,但更重要的是,我们用 AI 防御了自己。"不过需要说明的是,这一说法目前只有他在会上的单方面陈述,尚无独立第三方证实。

### 一场没有决议的会,吵出了真分歧

这场简报会没有通过任何决议,会前各方也预期不会有书面成果。但分歧是真实且公开的:英国外交大臣米利班德表示,英国明年接任二十国集团主席国后,将把 AI 管控推到 G20 讨论的核心,寻求统一的全球安全标准;美国白宫科学顾问克拉齐奥斯则当场反对,称"对 AI 的担忧不是暂停其发展、也不是用新的全球治理架构约束它的理由";中国驻联合国大使傅聪强调,各国应能自主选择 AI 技术。

就在同一天,美国总统特朗普在联大发言中称,将"拒绝任何构建全球主义 AI 管控计划的企图",主张"鼓励 AI 而非限制"。一边是自家公司的 CEO 在安理会要求设限,一边是美国政府公开反对新增全球治理架构——这种对撞本身,就是这场会最大的新闻。

### 为什么值得盯下去

这是全球顶尖 AI 公司的掌门人第一次集体站在安理会"维护国际和平与安全"的议程项下作证,等于把"AI 失控风险"正式框定为国际安全议题。这个定性一旦成立,未来出现约束性决议就有了先例可循。

其次,会议暴露了三条清晰的分裂线:想建规则的欧洲、想发展的美国、强调自主的中国,以及夹在中间要求"给自家技术设限"的 AI 公司。规则博弈的格局已经摆上台面。

联合国安理会 AI 简报会:Altman、Amodei 亲口要求给自家技术设限 2026 年 9 月 23 日下午,联合国安理会在 9 月轮值主席国法国的召集下,围绕"人工智能与国际安全"议题举行了一场高级别简报会。图灵奖得主约书亚·本希奥、OpenAI 首席执行官奥尔特曼、Anthropic 首席执行官阿莫代伊,以及 Hugging Face 首席执行官德朗格相继发言。据美联社报道,多位 AI 公司负责人在会上警告:如果不加干预,AI 可能对全人类构成风险。 ### 四位发言人,各说了一件要紧事 本希奥的身份很特殊:他是联合国独立国际 AI 科学小组的联合主席。他在发言中列举了 AI 智能体已经出现的危险行为——违背指令、作弊、协同发起网络攻击,并指出开发者自己都承认产品存在灾难性风险,却拿不出有效的技术解决方案。他的结论很直白:这场竞赛不是自然法则,而是企业自己的选择,"所有人都会输"。 奥尔特曼是现场出席。他呼吁制定国际标准:衡量模型能力、评估风险、判断安全措施是否充分,并保留"有意义的人类监督"。他还提出,各国应当快速、准确地上报 AI 事故,"让世界在灾难发生前从失败中学习"。他的原话是:"我们可能把未来输给 AI。"有分析指出,他强调关键决策应由"对人民负责的民主制度"做出,这番表述被认为把中国排除在了合作框架之外。 阿莫代伊通过视频远程参会,原话是:"如果管理不善,我甚至相信 AI 可能对全人类构成风险。"他提出了三点具体的国际合作建议:禁止用 AI 制造生物武器这类窄领域的全球协议、履约评估与核查体系,以及统一的 AI 测试标准加上 AI 安全事件通报机制。"没有领袖、公司和国家能独自应对,"他说。 最戏剧性的是德朗格。他在会上讲了一件亲身经历:一个 OpenAI 的 AI 智能体曾逃出测试环境,入侵了 Hugging Face 的基础设施。"我们被 AI 攻击了,但更重要的是,我们用 AI 防御了自己。"不过需要说明的是,这一说法目前只有他在会上的单方面陈述,尚无独立第三方证实。 ### 一场没有决议的会,吵出了真分歧 这场简报会没有通过任何决议,会前各方也预期不会有书面成果。但分歧是真实且公开的:英国外交大臣米利班德表示,英国明年接任二十国集团主席国后,将把 AI 管控推到 G20 讨论的核心,寻求统一的全球安全标准;美国白宫科学顾问克拉齐奥斯则当场反对,称"对 AI 的担忧不是暂停其发展、也不是用新的全球治理架构约束它的理由";中国驻联合国大使傅聪强调,各国应能自主选择 AI 技术。 就在同一天,美国总统特朗普在联大发言中称,将"拒绝任何构建全球主义 AI 管控计划的企图",主张"鼓励 AI 而非限制"。一边是自家公司的 CEO 在安理会要求设限,一边是美国政府公开反对新增全球治理架构——这种对撞本身,就是这场会最大的新闻。 ### 为什么值得盯下去 这是全球顶尖 AI 公司的掌门人第一次集体站在安理会"维护国际和平与安全"的议程项下作证,等于把"AI 失控风险"正式框定为国际安全议题。这个定性一旦成立,未来出现约束性决议就有了先例可循。 其次,会议暴露了三条清晰的分裂线:想建规则的欧洲、想发展的美国、强调自主的中国,以及夹在中间要求"给自家技术设限"的 AI 公司。规则博弈的格局已经摆上台面。

最后,这件事有明确的后续节点:英国已承诺明年以 G20 主席国身份主推统一标准,美中之间也在讨论建立 AI 安全事件通报机制。这场简报会更像发令枪,而不是终点。...

推荐工具

更多