Le mécanisme d’attention signifie simplement que le modèle apprend à « regarder les points clés » lors du traitement de l’information. Lorsqu’une personne lit un paragraphe, elle ne regarde pas chaque mot de la même manière, et le modèle est le même : il attribue des poids différents à différents mots ou fragments selon la tâche à accomplir. Un contenu de forte intensité a plus de chances d’influencer les résultats, et un contenu peu pondéré est comme un bruit de fond.
C’est pourquoi, dès que le mécanisme d’attention apparaît, l’effet du grand modèle change significativement. Le modèle précédent ressemblait plutôt à une lecture précise dans l’ordre, et j’oubliais souvent le devant quand je lisais le dos ; Avec le mécanisme d’attention, le modèle peut revenir chercher des informations plus pertinentes à l’étape actuelle, donc les phrases longues, les relations entre phrases croisées et la compréhension contextuelle seront bien meilleures.
Qu’est-ce que ça fait ?
Vous pouvez considérer le mécanisme d’attention comme une « table de notation de corrélation ». Avant de générer un mot, le modèle détermine quels mots de l’entrée sont les plus pertinents pour la tâche en cours, puis amplifie l’impact de ces mots. La clé ici n’est pas de « tout se souvenir », mais de « savoir à qui s’adresser à chaque étape ».
Ainsi, le mécanisme d’attention ne résout pas le problème de stockage, mais le problème de récupération. Le modèle ne comprend pas vraiment le texte complet comme un humain, il est simplement meilleur pour trouver la partie la plus utile de l’information actuelle dans la quantité massive d’informations. Son rôle est évident en matière de traduction, de synthèse, de questions-réponses et de compréhension du code. Lorsque vous résumez un long article, le modèle peut en saisir le titre, l’entité et la relation, et c’est également le cas.
Dans un modèle réel, le mécanisme d’attention ne fonctionne généralement pas seul, mais coopère avec des modules tels que le codage de position, le réseau feedforward et la connexion résiduelle pour former une architecture complète.
Les idées reçues les plus courantes
- Mythe 1 : L’attention est la même chose que la pensée. En réalité, ce n’est qu’un mécanisme de sélection pondérée.
- Mythe 2 : Plus vous avez d’attention, plus vous devez être fort. En réalité, cela dépend aussi des données d’entraînement, de l’échelle des paramètres et de la conception structurelle.
- Mythe 3 : L’attention se souvient parfaitement de tous les contextes. Avec beaucoup de texte long, le modèle sera toujours affecté par la fenêtre de contexte et le bruit.
Ce qui importe vraiment, c’est que le mécanisme d’attention permette au modèle de passer de la « lecture séquentielle mécanique » à la « lecture dynamique des clés ». C’est aussi la raison pour laquelle elle est devenue presque la configuration standard au bas des grands modèles.