Le pré-entraînement est la première phase d'entraînement d'un grand modèle de langage : avant d'apprendre à discuter ou à coder, le modèle fait une seule chose sur d'énormes volumes de texte — deviner le mot suivant, encore et encore. Cette phase ne lui apprend ni la politesse ni l'obéissance aux instructions ; elle inscrit seulement dans ses paramètres les régularités statistiques de la langue, les associations de faits et les habitudes d'expression. Les capacités de conversation et le style de raisonnement que vous connaissez reposent sur cette fondation.
Une seule tâche d'entraînement : deviner le mot suivant
La tâche est étonnamment simple. On donne un passage au modèle, on masque le mot qui suit et on le laisse deviner ; s'il se trompe, on ajuste les paramètres, s'il a raison, on les renforce. Après des milliers de milliards d'exercices de ce type, le modèle apprend progressivement les liens entre grammaire, sens commun et terminologie spécialisée.
Cette méthode s'appelle l'apprentissage auto-supervisé : les réponses sont cachées dans le texte lui-même, sans annotation humaine au cas par cas. C'est aussi ce qui permet au pré-entraînement de passer à une telle échelle — pages web, livres, articles et dépôts de code deviennent, une fois nettoyés, des manuels tout prêts.
Ce qu'il lit compte plus que la quantité
La qualité du manuel fixe le plafond. Les recettes des laboratoires se ressemblent : rassembler des corpus bruts depuis le web public, les livres, les encyclopédies et le code, puis dédupliquer, filtrer les contenus de mauvaise qualité et retirer les informations privées. La tendance nette de ces dernières années est « moins, mais mieux » : plutôt que d'ingérer tout le web bruité, on augmente la part des données de type manuel et du code.
Ainsi, quand on évalue un modèle, « le nombre de tokens d'entraînement » n'est qu'un indicateur d'échelle, pas une mesure directe de qualité. Deux modèles de taille comparable, mais nourris de mélanges différents, peuvent différer d'un niveau entier en programmation et en mathématiques.
Pré-entraînement et post-entraînement : la répartition des rôles
Le résultat du pré-entraînement s'appelle un modèle de base. Il sait beaucoup de choses, mais se comporte comme une « machine à continuer » : posez-lui une question, et il peut inventer la suite sous forme de questions-réponses au lieu de répondre. Pour en faire l'assistant actuel, qui répond et sait refuser les demandes inappropriées, il faut deux étapes de plus : un ajustement supervisé à partir de démonstrations humaines, puis un alignement par retour de préférences humaines.
Une façon simple de retenir la répartition : le pré-entraînement décide de ce qu'il sait et de la solidité des fondations ; le post-entraînement décide de sa manière de traiter les gens. Le même modèle de base peut donner des assistants de styles très différents selon la recette de post-entraînement.
Trois malentendus fréquents
Premièrement, le pré-entraînement ne consiste pas à mémoriser les textes originaux dans une base de données. Le modèle stocke des régularités statistiques paramétrées, pas une bibliothèque interrogeable ; il récite couramment des passages célèbres parce qu'ils apparaissent souvent dans le corpus, pas parce qu'il aurait conservé les fichiers. C'est aussi l'une des raisons pour lesquelles il peut se tromper avec assurance : il génère des énoncés plausibles, pas des faits vérifiés.
Deuxièmement, la fin du pré-entraînement ne signifie pas la fin de l'entraînement. Utiliser un modèle de base tel quel comme produit de discussion donne en général une expérience médiocre ; quand un fournisseur annonce un « modèle », tout le pipeline de post-entraînement est inclus par défaut.
Troisièmement, le pré-entraînement n'est pas une éducation unique pour la vie. Les grands laboratoires continuent d'entraîner sur de nouvelles données et publient de nouvelles versions ; quand un modèle semble plus intelligent, le mérite revient souvent à une nouvelle fournée de données de pré-entraînement et à son dosage, pas seulement à des réglages de paramètres.