ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Encyclopédie de l’IA
Distillation des connaissances : comment les grands modèles « enseignent » aux petits — principes, limites et trois idées reçues

Distillation des connaissances : comment les grands modèles « enseignent » aux petits — principes, limites et trois idées reçues

Encyclopédie de l’IA • Admin • • 7 vues

La distillation des connaissances (Knowledge Distillation) est une technique par laquelle un petit modèle (le modèle élève) apprend d'un grand modèle déjà entraîné (le modèle enseignant). Elle a été formalisée par Geoffrey Hinton et ses collègues dans leur article de 2015 « Distilling the Knowledge in a Neural Network ». L'objectif : permettre à un modèle plus petit et plus rapide de conserver autant que possible les capacités du grand modèle.

Le mécanisme central : l'élève apprend l'« hésitation » de l'enseignant, pas seulement la réponse

L'entraînement classique n'utilise que des « étiquettes dures » : cette image montre un chat, on enregistre donc 100 % chat. Le modèle enseignant fournit au contraire des « étiquettes douces » : 70 % chat, 20 % tigre, 10 % autre chose. Hinton a appelé cette information la « dark knowledge » (connaissance obscure) : les relations de similarité entre les classes sont ce que l'enseignant a vraiment appris.

Pour révéler ces faibles signaux de probabilité, la distillation introduit un paramètre de température T : les logits de l'enseignant sont divisés par T avant l'application du softmax. Plus T est grand, plus la distribution devient « douce » : les classes secondaires écrasées à 0,1 % sont relevées, et l'élève peut discerner la structure de décision de l'enseignant. La perte d'entraînement de l'élève est une somme pondérée de deux termes : une divergence KL qui suit les étiquettes douces de l'enseignant, et la perte d'entropie croisée habituelle contre les étiquettes dures.

Les ingrédients clés de la distillation des connaissances

Une distillation complète nécessite quatre éléments : un modèle enseignant entraîné (généralement un grand modèle), un modèle élève à entraîner (une petite architecture), le paramètre de température T, et le ratio de pondération entre les pertes douce et dure. L'enseignant « pose l'examen et fournit le corrigé », tandis que l'élève cherche l'équilibre entre imiter la distribution de sortie de l'enseignant et rester fidèle aux vraies étiquettes.

Le plafond de la distillation : quand vaut-il mieux entraîner directement ?

La distillation n'est pas une baguette magique. D'abord, le plafond de l'élève est à peu près fixé par l'enseignant : si l'enseignant est faible sur une tâche, l'élève n'apprendra qu'à « se tromper comme l'enseignant ». Ensuite, un élève de capacité trop réduite « ne peut pas apprendre » — les connaissances de l'enseignant ne tiennent pas dans un réseau trop petit. Troisièmement, la distillation a un coût initial : générer les étiquettes douces exige d'abord de faire tourner le grand modèle enseignant. Enfin, si la tâche cible se situe hors de la distribution de prédilection de l'enseignant, mieux vaut entraîner directement le petit modèle sur les données cibles.

Trois idées reçues fréquentes

Idée reçue n° 1 : la distillation, c'est de la compression, donc équivalent à la quantification ou à l'élagage. Les trois rendent les modèles plus petits et plus rapides, mais la distillation intervient pendant l'entraînement et transfère des capacités ; la quantification intervient au déploiement et réduit la précision numérique ; l'élagage supprime les paramètres redondants. On peut les combiner (distiller puis quantifier est une combinaison courante), mais pas les substituer l'une à l'autre.

Idée reçue n° 2 : l'élève ne peut jamais dépasser l'enseignant. Dans la plupart des cas, l'enseignant est bien le plafond, mais la perte mélange aussi de vraies étiquettes dures, si bien qu'un élève affiné sur les données de la tâche peut parfois surpasser l'enseignant sur une métrique donnée.

Idée reçue n° 3 : la distillation est sans perte. Presque toute distillation coûte un peu de performance ; la question est de savoir combien et où. L'envers du décor de « conserve 97 % des performances » est que les 3 % manquants ont tendance à se concentrer dans la longue traîne et les exemples difficiles.

Où se situe vraiment la frontière entre distillation, quantification et élagage ?

En une phrase : la distillation change « la façon dont le modèle apprend » et produit un tout nouveau petit modèle ; la quantification change « la façon dont les nombres sont stockés », l'architecture restant pour l'essentiel inchangée ; l'élagage change « la part de structure conservée » en supprimant directement des paramètres. Les trois agissent à des étapes différentes du cycle de vie d'un modèle, apparaissent souvent ensemble, mais résolvent des problèmes différents. Pour une version plus accessible, voir notre article précédent La distillation de modèles : pourquoi de plus en plus de « petits modèles » rattrapent les grands.

Des applications bien réelles

L'exemple classique est DistilBERT de HuggingFace : avec BERT pour enseignant, le modèle élève compte 40 % de paramètres en moins, tourne 60 % plus vite et conserve environ 97 % de la compréhension linguistique. L'ère des LLM a aussi sa vitrine : l'équipe DeepSeek-R1 a distillé DeepSeek-R1-Distill-Qwen-7B à partir de 800 000 exemples de raisonnement générés par R1, avec un taux de réussite de 55,5 % au test de mathématiques AIME 2024 — largement au-dessus des modèles directement entraînés de même taille. Derrière les petits modèles qui tournent aujourd'hui dans les assistants vocaux des smartphones, le service client embarqué ou les systèmes automobiles, il y a le plus souvent de la distillation.

Outils Recommandés

Plus