Le surapprentissage, c'est lorsqu'un modèle mémorise trop bien ses données d'entraînement, bruit et détails accidentels compris : excellent sur les exercices déjà vus, il chute nettement dès qu'arrivent des données nouvelles. Pour juger un modèle, ne regardez pas ses performances sur les questions entraînées, mais sa capacité à appliquer la règle à des problèmes inédits. Un modèle surappris n'a pas appris la règle. Il a récité les réponses.
Pourquoi les scores d'entraînement s'éloignent du niveau réel
S'entraîner, c'est chercher des régularités dans les données. Or les données mêlent vraies régularités et bruit : erreurs de saisie, coïncidences, particularités qui ne valent que pour ce lot précis. Plus les cycles d'entraînement et les paramètres sont nombreux, plus le modèle peut absorber aussi le bruit. Le signal classique suit : l'erreur sur les données d'entraînement continue de baisser, celle sur les données de validation baisse puis remonte. Le point où les deux courbes divergent marque le début de la mémorisation.
L'échec inverse est le sous-apprentissage : le modèle ne capte même pas les régularités de base et échoue partout. Un bon modèle se situe entre les deux. Méfiez-vous aussi d'une cause cachée, la fuite de données : une information qui ne devrait apparaître qu'au test glisse dans l'entraînement. Elle produit de faux scores brillants, plus difficiles à repérer qu'un surapprentissage ordinaire, car même les résultats de test semblent excellents.
Quand cela arrive le plus souvent
D'abord, trop peu de données pour un modèle trop puissant : c'est l'élève à la mémoire photographique à qui l'on ne donne que dix exercices — changez un chiffre et il est perdu. Ensuite, répéter les mêmes données trop longtemps rend le modèle fluide sur le connu et rigide sur le légèrement différent. Enfin, des données bruyantes et mal nettoyées sont apprises au pied de la lettre, étiquettes erronées incluses. L'ajustement fin des grands modèles n'y échappe pas : répéter un petit jeu d'exemples métier fait apprendre la formulation des exemples, pas la logique de la tâche.
Trois idées reçues
Première idée reçue : un score d'entraînement plus élevé signifie un modèle plus fort. Ce score montre seulement l'étroitesse de l'ajustement à ce lot de données ; passé un point, chaque gain d'ajustement peut coûter de la généralisation réelle. C'est pourquoi l'on compare les modèles sur des jeux de test étrangers à l'entraînement.
Deuxième : seuls les petits modèles surapprennent. C'est l'inverse — plus de paramètres, plus de capacité de mémorisation. Le pré-entraînement dilue le problème grâce à des masses de données, mais en ajustement fin sur peu de données, le surapprentissage est le premier danger à écarter.
Troisième : davantage de données règlent le problème. Si les ajouts ne sont que copies et reformulations du même contenu, avec une déduplication négligée, le modèle s'entraîne en fait plusieurs fois sur les mêmes exemples. Ce qui compte, c'est le volume d'information, pas la taille des fichiers.
Comment un non-spécialiste repère un modèle qui récite
Changez la question : permutez chiffres, noms ou ordre, ou découpez-la en deux étapes. S'il est brillant sur l'original et s'effondre après une petite modification, il récite au lieu de raisonner. Observez aussi sa réaction face à l'inconnu : un contenu jamais entraîné devrait déclencher une incertitude raisonnable, pas un gabarit forcé. Et comparez la gloire des classements à l'usage quotidien : les modèles en tête des palmarès qui trébuchent chaque jour souffrent souvent d'un fort recouvrement entre données de test et d'entraînement.
Pour choisir ou ajuster un modèle, les défenses sont sans glamour : réserver des données qui ne participeront jamais à l'entraînement pour un contrôle final, surveiller la courbe de validation et s'arrêter à temps, dédupliquer et nettoyer correctement. La ligne de partage — apprendre des régularités ou mémoriser des réponses — décide de ce qui reste du modèle une fois sorti de la salle d'entraînement.