Les capacités émergentes sont des capacités de tâche que les petits modèles ne parviennent pratiquement pas à accomplir, mais qui deviennent soudainement possibles une fois que la taille d'un modèle franchit un certain seuil. Il ne s'agit pas d'une amélioration ordinaire et progressive, mais d'un saut apparent du néant à quelque chose : lorsqu'un modèle est petit, il se trompe presque partout en calcul en plusieurs étapes et n'apprend pas un nouveau format même si on lui donne plusieurs exemples ; une fois assez grand, il résout soudain correctement les mêmes problèmes, avance pas à pas dans un raisonnement complexe et peut apprendre une nouvelle tâche sur-le-champ à partir d'exemples. Cette capacité à apprendre à partir d'exemples s'appelle l'apprentissage en contexte, et c'est l'exemple d'émergence le plus souvent cité.
Pourquoi la progression globale est régulière, mais les capacités individuelles font des sauts
On ne peut pas parler d'émergence sans évoquer les lois d'échelle. Celles-ci décrivent le fait que, lorsque le nombre de paramètres, la quantité de données et la puissance de calcul augmentent, la perte de prédiction globale d'un modèle sur de grandes quantités de texte diminue de façon régulière et prévisible. Le problème, c'est qu'une perte globale régulière ne signifie pas que chaque tâche progresse de façon régulière. Des tâches comme les questions à choix multiples ou les problèmes à plusieurs étapes exigent que toute une chaîne d'étapes soit juste ; une seule étape fausse rend la réponse finale fausse. Un petit modèle s'en approche en réalité petit à petit, mais tant qu'il lui manque encore quelques étapes pour être entièrement juste, son relevé de notes n'affiche que des zéros. Dès que la précision de chaque étape franchit un point critique, le problème entier se résout soudain, et la courbe montre un saut.
Le débat : une partie de l'émergence pourrait être un artefact de l'évaluation
La question de savoir si l'émergence signifie qu'un changement qualitatif a réellement eu lieu à l'intérieur du modèle reste débattue. Certains travaux soulignent que beaucoup de sauts rapportés sont liés au choix de l'indicateur d'évaluation : si l'on ne regarde qu'un indicateur du tout ou rien, comme le fait que la réponse finale soit juste, la progression est compressée en marches d'escalier. En passant à un indicateur plus continu, par exemple en mesurant à quel point chaque prédiction de jeton est proche ou en accordant des points partiels pour les étapes correctes, les courbes des mêmes modèles deviennent beaucoup plus lisses et la sensation de saut s'atténue fortement. Cela rappelle que lorsqu'une capacité semble surgir soudainement, on ne peut pas en conclure directement qu'un changement qualitatif a dû se produire dans le modèle ; une partie de l'effet peut être amplifiée par la méthode de mesure. Cela ne réfute pas l'émergence pour autant ; cela montre seulement qu'il faut distinguer les changements du modèle de ceux de l'indicateur.
Les limites : impossible à prédire précisément, et les paramètres ne sont pas la seule variable
La limite la plus pratique de l'émergence est qu'elle ne peut pas être prédite avec précision. Personne ne peut calculer à l'avance à quelle taille une capacité donnée apparaîtra ; elle ne peut être confirmée qu'après coup, une fois le modèle entraîné et testé. Toutes les capacités n'émergent pas non plus : certaines tâches ne s'améliorent que lentement avec la taille, d'autres restent mauvaises quoi qu'il arrive. Le nombre de paramètres n'est pas non plus la seule variable. La qualité des données, leur composition et les méthodes d'entraînement modifient aussi le moment où une capacité apparaît, et deux modèles au nombre de paramètres proche peuvent avoir des performances très différentes. On peut donc dire que la taille est un seuil pour l'émergence, mais pas que l'accumulation de paramètres achète nécessairement une capacité précise.
Il faut aussi dissiper deux malentendus courants. L'émergence ne signifie pas un éveil de la conscience. Elle décrit un changement de performance sur des tâches, un phénomène mesurable et reproductible, ce qui est tout autre chose que la question de savoir si un modèle a une expérience subjective. L'émergence ne signifie pas non plus que plus grand rime avec tout-puissant. Les sauts ne se produisent que sur certaines tâches, et le même modèle peut continuer à se tromper fréquemment sur d'autres. Comprendre l'émergence comme un changement de capacité limité et pas entièrement contrôlable, apporté par la taille, est plus proche de son sens réel en recherche que de l'imaginer comme un mystérieux éveil.