RAG signifie Génération Augmentée par la Récupération, communément appelée Génération Augmentée par Récupération en chinois. Son essentiel n’est pas que le modèle se souvienne de toutes les informations, mais de d’abord chercher du contenu pertinent dans des bases de connaissances externes avant de répondre, puis de faire générer des réponses par le grand modèle à partir de ces informations.
Quel problème cela résout-il ?
Les grands modèles ordinaires reposent uniquement sur les connaissances acquises lors de la formation et les entrées actuelles, et sont sujets à des erreurs lorsqu’ils rencontrent les politiques de l’entreprise, les documents produit, les termes contractuels ou les derniers matériaux. RAG sépare « trouver des informations » de « rédiger des réponses » : le système de récupération est responsable de la recherche des fragments de documents pertinents, tandis que le modèle les organise, explique et exprime.
Le processus de base du RAG
- Divisez le document en segments plus petits, en conservant les métadonnées telles que le titre, la source et les permissions.
- Utilisez le modèle d’Embedding pour convertir les questions et les fragments de documents en vecteurs.
- Utilisez des bases de données vectorielles ou des moteurs de recherche pour trouver les segments les plus pertinents.
- Insérez le clip dans la consigne et laissez le modèle répondre en fonction des preuves.
- Si nécessaire, retournez à la source pour une vérification manuelle.
RAG ne signifie pas d’hallucinations
Le RAG ne peut réduire que les hallucinations et ne les élimine pas automatiquement. Si la recherche est incomplète, les tranches sont trop faibles, des erreurs de filtrage des permissions, les clips sont obsolètes ou les exigences des prompts sont floues, tout cela fera que la réponse sera hors sujet. De nombreux échecs de questions-réponses dans la base de connaissances ne sont pas dus à de mauvais modèles, mais au fait que la récupération et la gouvernance des documents ne sont pas bien réalisées.
Pour quels scénarios sont-ils adaptés ?
RAG convient aux bases de données d’entreprise, aux questions-réponses du service client, aux recherches de politiques, à la gestion de documents papier et aux assistants de manuels de produits. Il n’est pas adapté aux tâches nécessitant la création de modèles à partir de rien, un raisonnement mathématique complexe ou manquant de sources de données fiables. Pour décider si un projet doit utiliser RAG, vous pourriez vous demander : la réponse doit-elle venir d’un lot de données externes traçables ? Si oui, RAG est généralement plus stable qu’une simple demande.