2026年9月24日,小米 MiMo 团队公布了 MiMo-V3 的核心架构 HySparse2。这是此前公开的第一代 HySparse 的升级版,面向长程多轮 Agent 任务设计,目标是同时做到三件事:更少的 Prefill 计算、更小的 KV Cache、更精准的长上下文检索。
HySparse2 做了什么
HySparse2 把模型分成前后两部分:前半是 Self-Decoder,采用全注意力(Full Attention)与滑动窗口注意力(SWA)的混合结构;后半是 Cross-Decoder,采用全注意力与稀疏注意力(Sparse Attention)的混合结构。在此基础上引入两级 KV 共享。
第一级叫 KV Bridging,跨越前后两部分:后半部分每个全注意力层的 KV Cache,直接从前半部分对应全注意力层的输入隐藏状态生成,每个目标层保留独立的 K/V 投影。这样后半部分的 KV 不必等输入逐层走完才就绪。
第二级叫 KV Reuse,发生在每个 Hybrid Block 内部:一个全注意力层加随后多层稀疏注意力层组成一个块,全注意力层在计算的同时按注意力分数选出重要位置,后续稀疏层直接复用它的 KV Cache 和选择索引,不用再单独训练一个选择器。
另一处关键变化是选择粒度从“选一块”变成“选一个 token”。第一代 HySparse 做块级选择,为了命中一个重要 token,常把周围一整块都纳入计算;HySparse2 改为 token 级选择,同样的注意力预算可以更精细地分配。局部窗口依然保留:强制选中最近的 128 个 token,再从窗口外选 1024 个全局 token,两部分共用全注意力层提供的共享 KV Cache。独立 SWA 分支被取消,连带省掉了它的投影参数和 KV Cache 开销。
Prefill 提前一半结束
两级 KV 共享加上局部窗口合并,意味着后半部分所需的全部 KV Cache 都能从前半部分的隐藏状态构建出来。在 49 层的模型中,Prefill 只需执行前 25 层 Self-Decoder 加上桥接 KV 投影,其中只有一层是全注意力。在 Prefill 与 Decode 分离部署时,Prefill 节点只需要部署这部分 Self-Decoder 网络,模型权重存储接近减半。生成阶段仍然使用完整网络,保留后半部分的全局检索与建模能力。
实测数字
官方在 80B-A3B MoE 模型上,用相同数据和训练流程对比了 Hybrid SWA、HySparse 和 HySparse2(HySparse2 还用了更紧凑的 MQA 配置)。百万 token 下,相对 Hybrid SWA,HySparse2 的 Prefill 计算量降至 1/5,KV Cache 从 12GB 降到 2.7GB;相对第一代 HySparse,Prefill 计算量降至 1/3,KV Cache 从 6.7GB 降到 2.7GB。
经过相同的轻量后训练,在最高 256k 的评测范围内,HySparse2 在各项已测长度上都拿到了更高的 MRCR-v2 和 RULER-v2 分数,以及更低的 AgentPPL 和 LongPPL。相对第一代 HySparse,MRCR-v2 和 RULER-v2 各报告长度的平均分分别提高了 11.30 和 19.81 个百分点。官方的结论是:更少的 KV Cache 与更短的 Prefill,可以和更好的长文检索同时实现。
为什么是 Agent 需要这个
Agent 跑一个长任务,每轮工具调用都可能带回一整页网页、一份文件或长长的执行日志,历史不断变长,KV Cache 越来越大,每次读入新内容的 Prefill 也越来越贵。HySparse2 同时回答了三个问题:读入更快、显存更省、从长历史里找证据更准。这正是多轮 Agent 场景里最贵的三个环节。
怎么看
首先是路线延续:从 MiMo-V2 系列的 Hybrid SWA,到第一代 HySparse,再到 HySparse2,MiMo 团队一直在“模型能力与计算效率共同提升”这条线上推进,MiMo-V2.6 的全模态双版本也是同一思路的产物。
其次是分工互补:此前的 MiMo-UltraSpeed 通过低比特量化、投机解码等技术加速 Decode,HySparse2 则压低 Prefill 与缓存开销,两端分别优化。
边界也要说清楚:这次公开的是 MiMo-V3 的核心架构,V3 本体尚未发布;上面的数字是官方口径的内部对比,第三方独立评测还没有。但至少方向是明确的——长程 Agent 的成本,正在从架构层面被打下来。