ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Enzyklopädie
Was ist RAG? Die Unterschiede zu Fine-Tuning und Prompt Engineering

Was ist RAG? Die Unterschiede zu Fine-Tuning und Prompt Engineering

KI-Enzyklopädie • Admin • • 2 Aufrufe

RAG (Retrieval-Augmented Generation, abrufgestützte Generierung) ist eine Technik, die ein großes Sprachmodell erst recherchieren und dann antworten lässt: Vor der Antwort ruft das Modell relevante Inhalte aus einer externen Wissensdatenbank ab und formuliert seine Antwort auf dieser Grundlage. Es adressiert zwei chronische Schwächen von LLMs – Trainingsdaten mit Verfallsdatum und die Neigung, Unbekanntes selbstbewusst zu erfinden (Halluzinationen) – und verwandelt das Modell vom „Antworten aus dem Gedächtnis" zum „Antworten mit Nachschlagen".

Welche drei Schritte gibt es?

Der Ablauf besteht aus genau drei Schritten, alle stehen schon im Namen:

  1. Abruf (Retrieval): Die Nutzerfrage wird in einen Vektor umgewandelt; in einer Vektordatenbank oder einem Dokumentenspeicher werden die semantisch relevantesten Textstücke gefunden.
  2. Anreicherung (Augmented): Die gefundenen Stücke werden zusammen mit der Frage in den Prompt eingebettet – als bekäme das Modell Referenzmaterial für eine Open-Book-Prüfung.
  3. Generierung (Generation): Das Modell formuliert seine Antwort auf Basis dieses Materials; gute Implementierungen belegen zusätzlich jede Aussage mit ihrer Quelle, sodass sie prüfbar bleibt.

Wichtig ist die Grenze: RAG tauscht das „Referenzmaterial" aus, nicht die Modellgewichte; die Obergrenze der Qualität bestimmen die abgerufenen Textstücke.

RAG vs. Fine-Tuning

Die Unterscheidung in einem Satz: RAG wechselt das Referenzmaterial des Modells, Fine-Tuning wechselt das Modell selbst.

  • Das Modell soll interne Dokumente, private Daten oder zeitkritische Informationen beherrschen → RAG: Daten bleiben aktuell, Kosten niedrig, Antworten nachvollziehbar;
  • Das Modell soll Tonfall oder Ausgabeformat ändern oder wie ein Fachexperte schlussfolgern → Fine-Tuning: Die Fähigkeit wird in die Gewichte geschrieben.

Ein verbreiteter Irrtum ist, RAG als „Fine-Tuning für Arme" zu sehen: RAG trainiert nichts und löst keine Verhaltensprobleme; umgekehrt löst Fine-Tuning das Aktualitätsproblem nicht – am Tag nach dem Training ist neues Wissen schon wieder veraltet. Wie kostengünstiges Fine-Tuning funktioniert, zeigt Was ist LoRA-Fine-Tuning? Warum auch kleine Budgets spezialisierte Modelle trainieren können.

RAG vs. Prompt Engineering

Prompt Engineering beantwortet die Frage „Wie frage ich?", RAG die Frage „Mit welchem Material frage ich?".

Ein sorgfältig gestalteter Prompt hilft dem Modell, vorhandenes Wissen besser abzurufen und in vorgegebenem Format auszugeben – aber er erfindet keine Fakten, die das Modell nicht kennt. RAG liefert die Fakten direkt an. In der Praxis arbeiten beide oft zusammen: RAG liefert das Material, der Prompt setzt die Regeln – „Antworte nur auf Basis des bereitgestellten Materials, gib ehrlich zu, wenn es darin nicht steht, und belege jede Information mit ihrer Quelle."

Drei verbreitete Missverständnisse

Missverständnis 1: RAG heißt, das Modell im Web suchen zu lassen. Die Websuche ist nur ein Spezialfall von RAG (Abrufquelle: das gesamte Internet). In Unternehmen sucht RAG typischerweise in internen Wissensdatenbanken, Ticket-Systemen oder Produktdokumentationen; der Kern von RAG ist die Architektur „Abruf + Generierung", nicht der Vorgang „online gehen".

Missverständnis 2: Mit RAG gibt es keine Halluzinationen mehr. Sie lassen sich reduzieren, nicht ausrotten: Sind die abgerufenen Stücke irrelevant oder deutet das Modell das Material falsch, irrt es trotzdem. Der wahre Wert von RAG liegt darin, Fehler überprüfbar zu machen – die Antwort trägt ihre Quellen, sodass sich eingrenzen lässt, an welchem Materialstück es lag.

Missverständnis 3: Was ist besser, RAG oder Fine-Tuning? Das sind zwei verschiedene Dimensionen: eine regelt, „woher das Wissen kommt", die andere, „wie die Fähigkeit aussieht". In Produktivsystemen laufen beide häufig gemeinsam: Fine-Tuning legt den Verhaltensstil fest, RAG bindet aktuelles Wissen an.

Wofür eignet es sich am besten?

Frage-Antwort-Systeme über Unternehmenswissen (Kundenservice, automatische Antworten im internen Wiki), Assistenten für lange Dokumente (Fragen zu hunderte Seiten langen Verträgen, Handbüchern, Papers) sowie überall dort, wo Fehler teuer sind und Quellen zwingend prüfbar sein müssen. Wer dokumentübergreifende, globale Fragen behandeln will (etwa: „Welchen gemeinsamen Trend zeigen diese Geschäftsberichte?"), findet in der Variante GraphRAG einen Ansatz.

Empfohlene Tools

Mehr