ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Encyclopédie de l’IA
Qu'est-ce que le SFT (Supervised Fine-Tuning)? Pourquoi les modèles de conversation suivent une « formation » avant leur mise en service

Qu'est-ce que le SFT (Supervised Fine-Tuning)? Pourquoi les modèles de conversation suivent une « formation » avant leur mise en service

Encyclopédie de l’IA • Admin • • 6 vues

Le SFT (Supervised Fine-Tuning, affinage supervisé) est la « formation professionnelle » qu'un modèle de conversation suit avant sa « prise de poste »: à partir de milliers d'exemples « instruction-réponse », il apprend au grand modèle pré-entraîné à parler et à agir comme les humains l'attendent. Point important: il ne s'agit pas de lui injecter de nouvelles connaissances, mais de lui apprendre à « exprimer ce qu'il sait déjà dans le bon format ».

La répartition des rôles: pré-entraînement, SFT, RLHF

Le pipeline d'entraînement d'un modèle de conversation suit généralement trois étapes: pré-entraînement → SFT → RLHF (ou des méthodes d'alignement comme DPO), chacune ayant un rôle totalement différent:

ÉtapeCe qui est apprisEn une phrase
Pré-entraînementLes règles du langage et les connaissances du monde à partir de textes massifsApprend à « parler et comprendre »
SFTÀ partir d'exemples d'instructions: suivre les instructions et répondre au format attenduApprend à « faire ce qu'on lui demande »
RLHF / DPOÀ partir des préférences humaines: être plus sûr et plus utileApprend à « satisfaire »

Comment fonctionne le SFT

Premièrement, on prépare un jeu de données d'instructions: des milliers de paires « instruction de l'utilisateur – réponse idéale », couvrant questions-réponses, rédaction, code, raisonnement, etc. Deuxièmement, la perte (loss) n'est calculée que sur la partie réponse: le modèle voit l'exemple entier, mais n'est évalué que sur la ressemblance de sa réponse avec la démonstration — la partie instruction ne compte pas. Troisièmement, la qualité l'emporte largement sur la quantité: des études montrent que quelques centaines à un millier de démonstrations de haute qualité donnent souvent de meilleurs résultats que des centaines de milliers de données bâclées.

Au passage, le SFT n'exige pas forcément un affinage complet. Des méthodes à paramètres efficaces comme l'affinage LoRA permettent de faire du SFT à faible coût, et constituent le choix courant des individus et des petites équipes.

Les limites du SFT

Premièrement, il ne peut pas apprendre les connaissances postérieures à sa date de coupure: le plafond de connaissances est fixé par le pré-entraînement; le SFT n'enseigne que « la manière de s'exprimer ». Deuxièmement, le plafond du clonage comportemental: le modèle ne peut au mieux atteindre que le niveau de ses données de démonstration, sans jamais dépasser ses « enseignants ». Troisièmement, les biais des données sont amplifiés: les préjugés et les erreurs des données de démonstration sont appris puis consolidés par le modèle.

Trois idées reçues fréquentes

Idée reçue 1: « Plus il y a de données SFT, mieux c'est. » Faux. De mauvaises données enseignent de mauvaises habitudes; ce sont les démonstrations de qualité qui comptent.

Idée reçue 2: « Après le SFT, le modèle devient plus intelligent. » Faux. Les connaissances du modèle ne changent pas; il devient simplement meilleur pour répondre. Le plafond de capacités a déjà été fixé au pré-entraînement.

Idée reçue 3: « Avec le SFT, plus besoin de prompt engineering ni de RAG. » Faux. Le SFT fixe le « comportement par défaut » du modèle, le RAG gère les « connaissances en temps réel », le prompt engineering gère « la tâche du moment » — trois couches distinctes qui ne se remplacent pas.

En substance, le SFT est une « formation aux habitudes professionnelles » pour le modèle: il ne change pas ce que le modèle sait, seulement la façon dont il répond.

Outils Recommandés

Plus