Attention éparse
Explique le fonctionnement de l'attention éparse, ses principales implémentations et ses arbitrages : comment les modèles ne calculent l'attention que sur les tokens clés pour réduire coût de calcul et mémoire sur les longs contextes, et quand cette approche est pertinente.
L'attention éparse garde les grands modèles de langage efficaces sur les longs contextes : au lieu d'une attention complète sur chaque token, le calcul se concentre sur les positions importantes — sélection de blocs, sélection au niveau du token ou partage des KV. Ce dossier retrace l'évolution de l'idée et d'architectures représentatives comme HySparse, et expose les arbitrages réels dans les tâches d'agents de longue haleine et l'inférence à un million de tokens.