SFT (Supervised Fine-Tuning, überwachte Feinabstimmung) ist die „Einarbeitung“, die ein Chat-Modell vor seinem „Arbeitsantritt“ durchläuft: Anhand tausender „Anweisung-Antwort“-Beispiele lernt ein vortrainiertes großes Modell, so zu sprechen und zu handeln, wie Menschen es erwarten. Wichtig ist: Es bekommt kein neues Wissen eingeimpft, sondern lernt, „das bereits Gelernte im richtigen Format auszudrücken“.
Arbeitsteilung von Vortraining, SFT und RLHF
Die Trainingspipeline eines Chat-Modells läuft üblicherweise in drei Stufen: Vortraining → SFT → RLHF (oder Alignments wie DPO), und jede Stufe hat eine völlig andere Aufgabe:
| Phase | Was wird gelernt | In einem Satz |
|---|---|---|
| Vortraining | Sprachmuster und Weltwissen aus riesigen Textmengen | Lernt „sprechen und verstehen“ |
| SFT | Aus Anweisungsbeispielen: Anweisungen befolgen und im erwarteten Format antworten | Lernt „tun, was verlangt wird“ |
| RLHF / DPO | Aus menschlichen Präferenzen: sicherer und nützlicher werden | Lernt „zu gefallen“ |
Wie SFT funktioniert
Erstens: ein Anweisungsdatensatz wird erstellt – tausende Paare aus „Benutzeranweisung und idealer Antwort“, die Fragen, Texte, Code und Schlussfolgerungen abdecken. Zweitens: Der Verlust (Loss) wird nur auf dem Antwortteil berechnet: Das Modell sieht das ganze Beispiel, wird aber nur danach bewertet, wie sehr seine Antwort der Demonstration ähnelt – der Anweisungsteil zählt nicht. Drittens: Qualität schlägt Quantität bei Weitem: Studien zeigen, dass einige hundert bis tausend hochwertige Demonstrationen oft besser abschneiden als Hunderttausende grober Daten.
Übrigens erfordert SFT nicht unbedingt ein vollständiges Fine-Tuning. Parametereffiziente Methoden wie LoRA-Fine-Tuning ermöglichen SFT zu geringen Kosten und sind die gängige Wahl für Einzelpersonen und kleine Teams.
Wo SFT an seine Grenzen stößt
Erstens: Wissen, das neuer ist als der Trainingsstichtag, kann nicht gelernt werden – die Wissensobergrenze wird im Vortraining gesetzt; SFT lehrt nur die „Ausdrucksweise“. Zweitens: die Grenze des Verhaltensklonings – das Modell kann höchstens das Niveau seiner Demonstrationsdaten erreichen, seine „Lehrer“ nicht übertreffen. Drittens: Verzerrungen in den Daten werden verstärkt – Vorurteile und Fehler in den Demonstrationsdaten werden vom Modell übernommen und verfestigt.
Drei verbreitete Missverständnisse
Missverständnis 1: „Je mehr SFT-Daten, desto besser.“ Falsch. Schlechte Daten lehren schlechte Gewohnheiten; hochwertige Demonstrationen zählen.
Missverständnis 2: „Nach SFT wird das Modell schlauer.“ Falsch. Das Wissen des Modells ändert sich nicht – es wird nur besser im Antworten. Die Fähigkeitsobergrenze wurde bereits im Vortraining festgelegt.
Missverständnis 3: „Mit SFT braucht man kein Prompt-Engineering und kein RAG mehr.“ Falsch. SFT legt das „Standardverhalten“ des Modells fest, RAG liefert „Echtzeit-Wissen“, Prompt-Engineering löst „die aktuelle Aufgabe“ – drei Ebenen, die jeweils eigenständig sind und sich nicht ersetzen lassen.
Im Kern ist SFT ein „Berufsverhaltenstraining“ für das Modell: Es ändert nicht, was das Modell weiß, sondern nur, wie es antwortet.