稀疏注意力可以简单理解成:不是让每个 token 都去看所有 token,而是有选择地只看其中一部分。这个词会反复出现在长上下文和推理成本讨论里,是因为标准全注意力虽然强,但一旦上下文特别长,计算和显存成本就会涨得很快。
为什么“全看一遍”会越来越贵
在标准注意力里,文本越长,彼此之间需要计算的关系就越多。短文本时还好,一到长文档、长代码、多轮历史,对资源的压力会迅速上来。稀疏注意力的思路就是:既然不是所有位置都同等重要,那就别全算。
它通常怎么稀疏
- 只看局部邻近内容,保留近期上下文。
- 给少量关键位置全局可见性,比如标题、锚点或摘要。
- 按规则或学习到的模式,选择更值得关注的片段。
为什么这个概念越来越热
- 长上下文已经从“实验卖点”变成真实产品需求。
- 模型越大、上下文越长,推理成本越需要精打细算。
- 推理模型和 Agent 任务更容易拉长链路,架构层优化就更重要。
不过稀疏注意力也不是白赚。你少看了一部分内容,就可能错过远距离依赖和隐藏关联。所以它的关键不是“越稀疏越好”,而是怎么在保留重要信息和控制成本之间做平衡。也正因为这个张力一直存在,长上下文一热,稀疏注意力就会跟着重新变热。