Le RAG (Retrieval-Augmented Generation, génération augmentée par récupération) est une technique qui fait d'abord chercher le modèle avant de répondre : avant de générer sa réponse, le grand modèle de langage récupère dans une base de connaissances externe les contenus pertinents pour la question, puis rédige sa réponse à partir de ces éléments. Il s'attaque à deux faiblesses chroniques des LLM — des données d'entraînement périmées et la tendance à inventer avec assurance ce qu'ils ignorent (les hallucinations) — en faisant passer le modèle du « répondre de mémoire » au « répondre en vérifiant ».
Quelles sont les trois étapes ?
Le processus ne compte que trois étapes, toutes déjà présentes dans le nom :
- Récupération (Retrieval) : la question de l'utilisateur est convertie en vecteur, et les passages les plus pertinents sur le plan sémantique sont retrouvés dans une base vectorielle ou documentaire ;
- Augmentation (Augmented) : les passages retrouvés sont intégrés au prompt avec la question — comme si l'on remettait au modèle la documentation d'un examen à livre ouvert ;
- Génération (Generation) : le modèle compose sa réponse à partir de ces éléments ; les bonnes implémentations citent en outre la source de chaque affirmation pour permettre la vérification.
À noter, la limite : le RAG change la « documentation de référence », pas les poids du modèle ; le plafond de qualité est fixé par les passages récupérés.
RAG vs fine-tuning
La distinction en une phrase : le RAG change la documentation de référence du modèle, le fine-tuning change le modèle lui-même.
- Besoin que le modèle maîtrise des documents internes, des données privées ou des informations périssables → RAG : données toujours à jour, coût faible, réponses traçables ;
- Besoin de changer le ton, le format de sortie, ou de raisonner comme un expert du domaine → fine-tuning : la capacité est inscrite dans les poids.
Erreur fréquente : voir le RAG comme un « fine-tuning du pauvre ». Le RAG n'entraîne rien et ne règle aucun problème de comportement ; inversement, le fine-tuning ne règle pas la fraîcheur des connaissances — le lendemain de l'entraînement, les nouvelles connaissances sont déjà périmées. Pour comprendre le fine-tuning à petit budget, voir Qu'est-ce que le fine-tuning LoRA ? Pourquoi un petit budget suffit à entraîner un modèle spécialisé.
RAG vs ingénierie de prompt
L'ingénierie de prompt répond à « comment poser la question », le RAG à « avec quelle documentation poser la question ».
Un prompt soigneusement conçu aide le modèle à mieux mobiliser ses connaissances et à respecter un format imposé — mais il n'invente pas des faits que le modèle ignore. Le RAG livre les faits directement. En pratique, les deux se combinent souvent : le RAG fournit la documentation, le prompt fixe les règles — « réponds uniquement à partir de la documentation fournie, avoue franchement quand elle ne contient pas la réponse, et cite la source de chaque information ».
Trois idées reçues
Idée reçue n° 1 : le RAG, c'est brancher le modèle sur la recherche web. La recherche web n'est qu'un cas particulier du RAG (source de récupération : tout Internet). En entreprise, le RAG interroge plutôt la base de connaissances interne, les tickets, la documentation produit ; son cœur est l'architecture « récupération + génération », pas l'acte de « se connecter ».
Idée reçue n° 2 : avec le RAG, fini les hallucinations. On les réduit, on ne les éradique pas : si les passages récupérés sont hors sujet ou si le modèle les interprète mal, il se trompe quand même. La vraie valeur du RAG est de rendre l'erreur vérifiable — la réponse porte ses sources, on peut donc identifier le passage fautif.
Idée reçue n° 3 : lequel est supérieur, le RAG ou le fine-tuning ? Ce sont deux dimensions différentes : l'une règle « d'où vient la connaissance », l'autre « à quoi ressemble la capacité ». En production, les deux sont souvent combinés : le fine-tuning fixe le style de comportement, le RAG branche les connaissances à jour.
Les cas d'usage idéaux
Le questions-réponses sur la connaissance d'entreprise (support client, réponses automatiques du wiki interne), les assistants pour documents longs (interroger des contrats, manuels ou articles de plusieurs centaines de pages), et tous les cas où une erreur coûte cher et où les sources doivent impérativement être vérifiables. Pour les questions globales à cheval sur plusieurs documents (par exemple : « quelle tendance commune se dégage de ces rapports ? »), la variante GraphRAG mérite le détour.