スパースアテンションとは何か? なぜ長い文脈や推論コストの問題がいつもそれについて語るのか
スパースアテンションは単純に、各トークンがすべてのトークンを見るのではなく、選択的に一部のトークンだけを見るということです。 この用語は、長い文脈と推論コストの議論で繰り返し登場します。なぜなら、標準的な全注意は強力ですが、文脈が特に長くなると計算コストやビデオメモリのコストが急速に増加するためです...
AI百科事典 • Admin •
83
Found 1 related articles