稀疏注意力(Sparse Attention)是什么?为什么长上下文和推理成本问题总会谈到它
稀疏注意力可以简单理解成:不是让每个 token 都去看所有 token,而是有选择地只看其中一部分。这个词会反复出现在长上下文和推理成本讨论里,是因为标准全注意力虽然强,但一旦上下文特别长,计算和显存成本就会涨得很快。 为什么“全看一遍”会越来越贵 在标准注意力里,文本越长,彼此之间需要计算的关系...
AI百科 • Admin •
83
找到 2 篇相关文章
稀疏注意力可以简单理解成:不是让每个 token 都去看所有 token,而是有选择地只看其中一部分。这个词会反复出现在长上下文和推理成本讨论里,是因为标准全注意力虽然强,但一旦上下文特别长,计算和显存成本就会涨得很快。 为什么“全看一遍”会越来越贵 在标准注意力里,文本越长,彼此之间需要计算的关系...
注意力机制,简单说就是让模型在处理信息时学会“看重点”。人读一段话时不会平均看每个字,模型也一样:它会根据当前任务,给不同词或片段分配不同权重。权重高的内容更容易影响结果,权重低的内容就像背景噪音。 这也是为什么注意力机制一出现,大模型的效果就明显变了。以前的模型更像按顺序硬读,读到后面经常忘前面;...