ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Encyclopédie de l’IA
Chain-of-Thought : la technique qui fait réfléchir l'IA avant de répondre

Chain-of-Thought : la technique qui fait réfléchir l'IA avant de répondre

Encyclopédie de l’IA • Admin • • 2 vues

Le Chain-of-Thought (CoT, chaîne de pensée) est une technique de prompt : au lieu de laisser le modèle répondre directement, on lui demande d'écrire d'abord ses étapes de raisonnement intermédiaires, et de ne donner sa conclusion qu'à la fin. Pour un problème de maths, il liste d'abord « définir les inconnues, poser l'équation, résoudre » au lieu de balancer un chiffre. Cette contrainte du « montrer son raisonnement d'abord » améliore souvent nettement la précision sur les problèmes complexes.

Le principe : les étapes d'abord, la réponse ensuite

Les grands modèles de langage génèrent les tokens un par un, et ce qui est déjà produit devient le contexte de la suite. Le Chain-of-Thought exploite exactement cela : une fois les étapes intermédiaires écrites, elles deviennent le fondement de la réponse finale. Des étapes solides, et la réponse « saute » rarement une étape décisive.

Des exemples montrés au déclencheur en une phrase

À l'origine, le CoT était few-shot : deux ou trois exemples « question + résolution détaillée » dans le prompt, et le modèle résout les nouvelles questions dans le même format. En 2022, Kojima et al. ont montré dans « Large Language Models are Zero-Shot Reasoners » que les exemples ne sont pas indispensables : un simple « Let's think step by step » ajouté à la question suffit pour que le modèle déroule lui-même son raisonnement. C'est le zero-shot CoT, qui a fait passer la précision sur le benchmark de maths GSM8K d'environ 10 % à environ 40 %. Les exemples conviennent aux tâches au format inhabituel ou à notation lourde ; le déclencheur en une phrase est plus rapide quand on n'a pas d'exemples sous la main.

Gagner par le vote : le décodage par self-consistency

La self-consistency (auto-cohérence) prolonge le CoT : on fait résoudre le même problème de nombreuses fois en Chain-of-Thought, chaque fois par un chemin possiblement différent, puis on retient la réponse la plus fréquente. La probabilité que plusieurs chaînes indépendantes commettent la même erreur est faible, donc le vote filtre les erreurs accidentelles. Le prix à payer : un coût de calcul multiplié.

À ne pas confondre avec un « modèle de raisonnement »

Le Chain-of-Thought est une méthode de prompt utilisable avec n'importe quel grand modèle de langage ; les « modèles de raisonnement » (comme o1 ou DeepSeek-R1) sont des types de modèles spécialement entraînés, pour qui penser étape par étape est une seconde nature. Les modèles ordinaires ont besoin du CoT pour se « rappeler » de raisonner pas à pas, les modèles de raisonnement le font naturellement — leur ajouter du CoT par-dessus rapporte généralement peu.

Quatre limites à connaître avant de s'en servir

D'abord, un coût élevé en tokens : chaque étape doit être générée, et les problèmes difficiles consomment plusieurs fois plus de tokens. Ensuite, les hallucinations de raisonnement : les étapes peuvent sembler impeccables alors que la conclusion est fausse — les modèles excellent à produire du texte qui ressemble à du raisonnement, donc les étapes clés exigent une vérification humaine. Troisièmement, un gain limité sur les petits modèles : l'effet dépend fortement des capacités de base, et les modèles trop petits se trompent souvent même avec des étapes. Enfin, l'accumulation d'erreurs dans les longues chaînes : plus il y a d'étapes, plus le risque d'erreur augmente, et une étape fausse peut faire dérailler toute la suite.

Deux idées reçues tenaces

Première idée reçue : avec le CoT, le modèle « raisonne vraiment ». Non — le CoT guide seulement le modèle vers la production d'un texte étape par étape ; il continue de prédire le token suivant par probabilité, sans mécanisme de vérification logique comparable au nôtre. Deuxième idée reçue : la chaîne affichée serait la « vraie pensée » du modèle et prouverait son explicabilité. C'est dangereux : les étapes montrées sont un texte généré pour l'utilisateur, pas le calcul interne réel du modèle. Des études ont trouvé des cas où le modèle fixait d'abord la conclusion puis inventait les étapes après coup — une pure rationalisation a posteriori.

Où ça vaut le coup d'essayer

Calculs mathématiques, raisonnement logique, planification en plusieurs étapes et Q&A exigeant des sources : c'est le terrain de jeu du CoT. Écriture créative, bavardage et simples recherches factuelles gaspillent le plus souvent des tokens : plus la dérivation exigée est rigoureuse, plus le CoT paie ; plus la réponse est ouverte et subjective, moins il est utile.

Le Chain-of-Thought transforme « réfléchir avant de parler » en opération reproductible. Connaître ses limites et ses idées reçues compte souvent plus que connaître son mode d'emploi.

Outils Recommandés

Plus