スパースアテンションは単純に、各トークンがすべてのトークンを見るのではなく、選択的に一部のトークンだけを見るということです。 この用語は、長い文脈と推論コストの議論で繰り返し登場します。なぜなら、標準的な全注意は強力ですが、文脈が特に長くなると計算コストやビデオメモリのコストが急速に増加するためです。
なぜ「全部読む」費用がどんどん高くなっているのでしょうか?
標準的な注意では、テキストが長いほど、互いに多くの関係性を計算する必要があります。 短いテキストなら問題ありませんが、長いドキュメント、長いコード、複数の履歴が続くと、リソースへのプレッシャーは急速に高まります。 注意が散らばるという考え方は、すべてのポジションが同じくらい重要ではないので、すべてを数えないことです。
通常どれくらいのまばらなのか
- 地元の近隣住民だけを見て、最近の文脈を意識してください。
- タイトル、アンカー、要約など、少数の主要な場所にグローバルな可視性を与えましょう。
- ルールや習得したパターンに従って、より注目すべきセグメントを選びましょう。
なぜこの概念がますます熱くなっているのか
- 長い文脈は「実験的なセールスポイント」から実際の製品需要へと変わりました。
- モデルが大きく、文脈が長いほど、推論コストはより慎重になります。
- 推論モデルやエージェントタスクはリンクを長くする可能性が高く、アーキテクチャ層の最適化はさらに重要です。
しかし、注意を欠くことは無駄ではありません。 コンテンツを見逃すと、遠距離の依存関係や隠れた関係を見逃してしまうかもしれません。 つまり、「少ないほど良い」ではなく、重要な情報を保持しつつコストを抑えるバランスを取ることが重要です。 まさにこの緊張感ゆえに、長い文脈が熱くなると、まらばらな注意が再び熱くなるのです。