KI-Alignment (AI Alignment) bezeichnet sämtliche Trainings- und Evaluierungsmethoden, mit denen das Verhalten eines großen Sprachmodells nach dem Vortraining an menschliche Absichten, Werte und Sicherheitsanforderungen angepasst wird. Das Vortraining lehrt das Modell nur „sprechen"; Alignment lehrt es, „gut zu sprechen".
Alignment ist weder Vortraining noch Fine-Tuning
Vortraining: Das Modell lernt aus riesigen Textmengen Sprachregeln und Weltwissen – in dieser Phase ist es nur ein „Textvervollständiger".
Fine-Tuning (SFT, überwachtes Fine-Tuning): Mit Frage-Antwort-Paaren lernt das Modell, „im Dialogformat zu antworten" – eine Art Einarbeitung.
Alignment: Geht noch einen Schritt über SFT hinaus und trainiert das Modell mit menschlichen Präferenzen, damit es bei gleichbleibender Fähigkeit Entscheidungen trifft, die den menschlichen Erwartungen besser entsprechen.
Als Vergleich: Das Vortraining macht aus dem Modell einen Studenten, der jedes Buch gelesen hat; SFT bringt ihm das Antwortformat für Prüfungen bei; Alignment bringt ihm bei, „was man sagen darf und was nicht".
Die drei wichtigsten Alignment-Methoden: RLHF, RLAIF und DPO
RLHF (Reinforcement Learning from Human Feedback): Menschen bewerten Modellantworten (welche ist besser), ein „Belohnungsmodell" lernt menschliche Präferenzen nachzuahmen, und Reinforcement Learning optimiert das Modell in Richtung höherer Bewertungen. Die bekannte Methode des frühen ChatGPT – wirksam, aber teuer, weil sie großflächige menschliche Annotationen braucht.
RLAIF (Reinforcement Learning from AI Feedback): Die „menschliche Bewertung" wird durch „KI-Bewertung" ersetzt – ein stärkeres Modell bewertet Antworten nach festgelegten Prinzipien. Schneller und billiger, aber wenn die bewertende KI verzerrt ist, verstärkt sich die Verzerrung.
DPO (Direct Preference Optimization): Kommt ohne Belohnungsmodell aus. Mit Vergleichsdaten aus „guter Antwort vs. schlechter Antwort" werden die Modellparameter direkt so angepasst, dass das Modell gute Antworten bevorzugt. Einfach und effizient – eine der heute beliebtesten Alignment-Methoden in der Open-Source-Community.
Was Alignment nicht kann
≠ Das Modell schlauer machen. Alignment fügt kein Wissen und keine Fähigkeiten hinzu; es passt nur das Verhalten an. Ein gut aligniertes Modell „weiß" nicht mehr als nach dem Vortraining.
≠ Halluzinationen beseitigen. Das Modell kann weiterhin selbstbewusst Dinge erfinden. Alignment senkt die Häufigkeit von Erfindungen, löst aber nicht das Grundproblem, dass das Modell „nicht weiß, was es weiß".
≠ Einmal-und-fertig. Neue Angriffsmethoden (wie Prompt Injection) können Alignment umgehen, daher sind laufende Pflege und Aktualisierung nötig.
Drei verbreitete Missverständnisse
Missverständnis 1: Alignment ist nur eine Blacklist von „verbotenen Aussagen". Blacklists sind Sicherheitsleitplanken (Filterregeln beim Deployment); Alignment formt das Modell während des Trainings – es „will" etwas nicht sagen, statt „nach dem Sagen gestoppt" zu werden.
Missverständnis 2: Ein aligniertes Modell ist ein sicheres Modell. Alignment senkt das Risiko, garantiert aber keine Sicherheit; feindliche Eingaben und Jailbreak-Prompts können es weiterhin umgehen.
Missverständnis 3: Nur große Unternehmen brauchen Alignment. Jedes Szenario, das ein Modell vor Nutzer bringt, braucht eine Form von Alignment – die Open-Source-Community macht es auch (z. B. DPO-Feinabstimmung offener Modelle).
Wann Sie Alignment bei der Arbeit spüren
Wenn Sie nach einer Bombenbauanleitung fragen und das Modell höflich ablehnt und eine sichere Alternative vorschlägt – das ist Alignment. Wenn Sie eine kontroverse Frage stellen und das Modell mehrere Perspektiven zeigt, statt Partei zu ergreifen – das ist Alignment. Wenn das Modell in Antworten von sich aus sagt „ich bin nicht sicher" oder „mein Wissen reicht bis zu einem bestimmten Jahr" – auch das ist Alignment.
Alignment ist unauffällig, aber es entscheidet, ob das Sprachmodell, mit dem Sie täglich chatten, ein „zuverlässiger Assistent" oder eine „sprechende, aber unzuverlässige Maschine" ist.