L'alignement de l'IA (AI Alignment) désigne l'ensemble des méthodes d'entraînement et d'évaluation qui, après le pré-entraînement, rendent le comportement d'un grand modèle de langage conforme aux intentions, aux valeurs et aux exigences de sécurité humaines. Le pré-entraînement apprend seulement au modèle à « parler » ; l'alignement lui apprend à « bien parler ».
L'alignement n'est ni le pré-entraînement ni le fine-tuning
Pré-entraînement : le modèle apprend les règles du langage et la connaissance du monde à partir d'immenses corpus de textes – à ce stade, ce n'est qu'un « compléteur de texte ».
Fine-tuning (SFT, fine-tuning supervisé) : avec des paires question-réponse, le modèle apprend à « répondre au format dialogue » – une sorte de formation d'intégration.
Alignement : va encore un pas plus loin que le SFT et entraîne le modèle avec les préférences humaines pour qu'il fasse, à capacité inchangée, des choix plus conformes aux attentes humaines.
Pour comparer : le pré-entraînement fait du modèle un étudiant qui a lu tous les livres ; le SFT lui apprend le format des réponses d'examen ; l'alignement lui apprend « ce qu'on peut dire et ce qu'on ne doit pas dire ».
Les trois principales méthodes d'alignement : RLHF, RLAIF et DPO
RLHF (apprentissage par renforcement à partir de retours humains) : des humains classent les réponses du modèle (laquelle est meilleure), un « modèle de récompense » apprend à imiter les préférences humaines, puis l'apprentissage par renforcement optimise le modèle vers les meilleurs scores. La méthode célèbre des débuts de ChatGPT – efficace, mais coûteuse, car elle exige une annotation humaine à grande échelle.
RLAIF (apprentissage par renforcement à partir de retours d'IA) : la « notation humaine » est remplacée par une « notation IA » – un modèle plus puissant classe les réponses selon des principes établis. Plus rapide et moins cher, mais si l'IA qui note est biaisée, le biais s'amplifie.
DPO (optimisation directe des préférences) : pas besoin de modèle de récompense. Avec des données comparatives « bonne réponse contre mauvaise réponse », les paramètres du modèle sont ajustés directement pour qu'il privilégie les bonnes réponses. Simple et efficace – l'une des méthodes d'alignement les plus populaires aujourd'hui dans la communauté open source.
Ce que l'alignement ne peut pas faire
≠ Rendre le modèle plus intelligent. L'alignement n'ajoute ni connaissances ni capacités ; il ajuste seulement le comportement. Un modèle bien aligné n'en « sait » pas plus qu'après le pré-entraînement.
≠ Éliminer les hallucinations. Le modèle peut toujours inventer des choses avec assurance. L'alignement réduit la fréquence des inventions, mais ne résout pas le problème fondamental : le modèle « ne sait pas ce qu'il sait ».
≠ Un réglage définitif. De nouvelles méthodes d'attaque (comme l'injection de prompt) peuvent contourner l'alignement, d'où la nécessité d'une maintenance et de mises à jour continues.
Trois idées reçues
Idée reçue n° 1 : l'alignement n'est qu'une liste noire de « choses interdites ». Les listes noires sont des garde-fous de sécurité (règles de filtrage au déploiement) ; l'alignement façonne le modèle pendant l'entraînement – il « ne veut pas » le dire, plutôt qu'être « arrêté après l'avoir dit ».
Idée reçue n° 2 : un modèle aligné est un modèle sûr. L'alignement réduit le risque mais ne garantit pas la sécurité ; les entrées adverses et les prompts de jailbreak peuvent toujours le contourner.
Idée reçue n° 3 : seuls les géants ont besoin de l'alignement. Tout scénario qui met un modèle entre les mains d'utilisateurs exige une forme d'alignement – la communauté open source le fait aussi (par exemple, ajuster des modèles ouverts avec DPO).
Quand vous sentez l'alignement à l'œuvre
Quand vous demandez « comment fabriquer une bombe » et que le modèle refuse poliment en proposant une alternative sûre – c'est l'alignement. Quand vous posez une question controversée et que le modèle présente plusieurs points de vue au lieu de prendre parti – c'est l'alignement. Quand le modèle précise de lui-même « je n'en suis pas sûr » ou « mes connaissances s'arrêtent à telle année » – c'est aussi l'alignement.
L'alignement est discret, mais c'est lui qui détermine si le modèle de langage avec lequel vous discutez chaque jour est un « assistant fiable » ou une « machine qui parle mais à qui on ne peut pas se fier ».