Le SFT (Supervised Fine-Tuning, affinage supervisé) est la « formation professionnelle » qu'un modèle de conversation suit avant sa « prise de poste »: à partir de milliers d'exemples « instruction-réponse », il apprend au grand modèle pré-entraîné à parler et à agir comme les humains l'attendent. Point important: il ne s'agit pas de lui injecter de nouvelles connaissances, mais de lui apprendre à « exprimer ce qu'il sait déjà dans le bon format ».
La répartition des rôles: pré-entraînement, SFT, RLHF
Le pipeline d'entraînement d'un modèle de conversation suit généralement trois étapes: pré-entraînement → SFT → RLHF (ou des méthodes d'alignement comme DPO), chacune ayant un rôle totalement différent:
| Étape | Ce qui est appris | En une phrase |
|---|---|---|
| Pré-entraînement | Les règles du langage et les connaissances du monde à partir de textes massifs | Apprend à « parler et comprendre » |
| SFT | À partir d'exemples d'instructions: suivre les instructions et répondre au format attendu | Apprend à « faire ce qu'on lui demande » |
| RLHF / DPO | À partir des préférences humaines: être plus sûr et plus utile | Apprend à « satisfaire » |
Comment fonctionne le SFT
Premièrement, on prépare un jeu de données d'instructions: des milliers de paires « instruction de l'utilisateur – réponse idéale », couvrant questions-réponses, rédaction, code, raisonnement, etc. Deuxièmement, la perte (loss) n'est calculée que sur la partie réponse: le modèle voit l'exemple entier, mais n'est évalué que sur la ressemblance de sa réponse avec la démonstration — la partie instruction ne compte pas. Troisièmement, la qualité l'emporte largement sur la quantité: des études montrent que quelques centaines à un millier de démonstrations de haute qualité donnent souvent de meilleurs résultats que des centaines de milliers de données bâclées.
Au passage, le SFT n'exige pas forcément un affinage complet. Des méthodes à paramètres efficaces comme l'affinage LoRA permettent de faire du SFT à faible coût, et constituent le choix courant des individus et des petites équipes.
Les limites du SFT
Premièrement, il ne peut pas apprendre les connaissances postérieures à sa date de coupure: le plafond de connaissances est fixé par le pré-entraînement; le SFT n'enseigne que « la manière de s'exprimer ». Deuxièmement, le plafond du clonage comportemental: le modèle ne peut au mieux atteindre que le niveau de ses données de démonstration, sans jamais dépasser ses « enseignants ». Troisièmement, les biais des données sont amplifiés: les préjugés et les erreurs des données de démonstration sont appris puis consolidés par le modèle.
Trois idées reçues fréquentes
Idée reçue 1: « Plus il y a de données SFT, mieux c'est. » Faux. De mauvaises données enseignent de mauvaises habitudes; ce sont les démonstrations de qualité qui comptent.
Idée reçue 2: « Après le SFT, le modèle devient plus intelligent. » Faux. Les connaissances du modèle ne changent pas; il devient simplement meilleur pour répondre. Le plafond de capacités a déjà été fixé au pré-entraînement.
Idée reçue 3: « Avec le SFT, plus besoin de prompt engineering ni de RAG. » Faux. Le SFT fixe le « comportement par défaut » du modèle, le RAG gère les « connaissances en temps réel », le prompt engineering gère « la tâche du moment » — trois couches distinctes qui ne se remplacent pas.
En substance, le SFT est une « formation aux habitudes professionnelles » pour le modèle: il ne change pas ce que le modèle sait, seulement la façon dont il répond.