L’attention rare peut simplement être comprise ainsi : au lieu que chaque jeton regarde tous les jetons, regardez sélectivement seulement une partie. Ce terme revient régulièrement dans les discussions sur le long contexte et le coût d’inférence car, bien que l’attention complète standard soit forte, une fois le contexte particulièrement long, le coût du calcul et de la mémoire vidéo augmente rapidement.
Pourquoi « tout lire » devient-il de plus en plus cher ?
Dans l’attention standard, plus le texte est long, plus il faut calculer les relations entre eux. C’est acceptable quand c’est un texte court, mais quand il s’agit de documents longs, de code long et de multiples cycles d’histoire, la pression sur les ressources augmentera rapidement. L’idée de l’attention parcime est la suivante : puisque toutes les positions ne sont pas également importantes, ne les comptez pas toutes.
Comme c’est généralement rare
- Regardez seulement les voisins locaux et gardez le contexte récent.
- Donnez une visibilité mondiale à un petit nombre de lieux clés, tels que des titres, des présentations ou des résumés.
- Suivez les règles ou les schémas appris pour choisir les segments les plus remarquables.
Pourquoi ce concept devient de plus en plus chaud
- Le contexte à long terme est passé d’un « argument de vente expérimental » à une véritable demande produit.
- Plus le modèle est grand et plus le contexte est long, plus le coût d’inférence sera prudent.
- Les modèles d’inférence et les tâches d’agent sont plus susceptibles d’allonger les liens, et l’optimisation de la couche architecturale est encore plus importante.
Mais l’attention rare n’est pas vaine. Si vous manquez certains contenus, vous risquez de passer à côté de dépendances à distance et de relations cachées. Ainsi, la clé n’est pas « plus il y a de rareté, mieux c’est », mais comment équilibrer la conservation des informations importantes et le contrôle des coûts. C’est précisément à cause de cette tension que, lorsque le contexte long est chaud, l’attention rare redevient chaude.