Pre-Training ist die erste Trainingsphase eines großen Sprachmodells: Bevor es chatten oder programmieren lernt, tut das Modell an riesigen Textmengen nur eines — es errät wiederholt das nächste Wort. In dieser Phase lernt es weder Höflichkeit noch das Befolgen von Anweisungen; es speichert lediglich die statistischen Muster der Sprache, Faktenverknüpfungen und Ausdruckgewohnheiten in seinen Parametern. Die vertraute Gesprächsfähigkeit und der Denkstil stehen auf dem Fundament, das das Pre-Training legt.
Nur eine Aufgabe: das nächste Wort erraten
Die Aufgabe ist erstaunlich schlicht. Man gibt dem Modell einen Text, verdeckt das folgende Wort und lässt es raten; liegt es falsch, werden die Parameter angepasst, liegt es richtig, werden sie verstärkt. Nach Billionen solcher Übungen lernt das Modell nach und nach die Zusammenhänge zwischen Grammatik, Allgemeinwissen und Fachbegriffen.
Dieses Verfahren heißt selbstüberwachtes Lernen: Die Antworten stecken im Text selbst, niemand muss sie einzeln von Hand beschriften. Deshalb lässt sich Pre-Training so stark skalieren — Webseiten, Bücher, Fachartikel und Code-Repositories werden nach der Bereinigung zu fertigen Lehrbüchern.
Was es liest, zählt mehr als wie viel
Die Qualität des Lehrbuchs bestimmt die Obergrenze. Die Rezepte der Anbieter ähneln sich: Rohkorpora aus öffentlichen Webseiten, Büchern, Enzyklopädien und Code sammeln, dann deduplizieren, minderwertige Inhalte filtern und private Daten entfernen. Der klare Trend der letzten Jahre lautet „weniger, aber besser": Statt das ganze verrauschte Web zu verfüttern, erhöhen Teams den Anteil lehrbuchartiger Daten und von Code.
„Auf wie vielen Token trainiert wurde", ist daher nur eine Größenangabe und kein direktes Qualitätsmaß. Zwei Modelle mit ähnlicher Parameterzahl, aber unterschiedlicher Datenmischung, können beim Programmieren und Rechnen um eine ganze Stufe auseinanderliegen.
Pre-Training und Post-Training im Zusammenspiel
Das Ergebnis des Pre-Trainings heißt Basismodell. Es weiß viel, verhält sich aber wie eine „Fortsetzungsmaschine": Stellt man ihm eine Frage, schreibt es womöglich einen erfundenen Frage-Antwort-Text weiter, statt zu antworten. Zum heutigen Assistenten, der Fragen beantwortet und unangemessene Anfragen ablehnt, wird es erst durch zwei weitere Schritte: überwachtes Feintuning mit menschlichen Beispielen und Ausrichtung an menschlichem Feedback.
Eine merkbare Aufteilung: Pre-Training entscheidet, wie viel es weiß und wie tragfähig das Fundament ist; Post-Training entscheidet, wie es mit Menschen umgeht. Dasselbe Basismodell kann mit anderem Post-Training zu Assistenten mit ganz unterschiedlichem Stil werden.
Drei verbreitete Missverständnisse
Erstens speichert Pre-Training keine Originaltexte in einer Datenbank. Das Modell hält parametrisierte statistische Muster, keine durchsuchbare Textbibliothek; berühmte Passagen kann es flüssig wiedergeben, weil sie im Korpus so oft vorkommen, nicht weil es die Dateien abgelegt hätte. Das ist auch ein Grund, warum es selbstsicher irren kann: Es erzeugt plausibel klingende Aussagen, keine recherchierten Fakten.
Zweitens ist mit dem Pre-Training das Training nicht zu Ende. Ein Basismodell direkt als Chatprodukt zu nutzen, fühlt sich meist schlecht an; wenn Anbieter ein „Modell" vorstellen, ist die komplette Post-Training-Pipeline standardmäßig enthalten.
Drittens ist Pre-Training keine einmalige Bildung fürs Leben. Große Anbieter trainieren laufend mit neuen Daten weiter und veröffentlichen neue Versionen; wenn sich ein Modell klüger anfühlt, geht das oft auf eine neue Runde Pre-Training-Daten und deren Mischung zurück, nicht nur auf Parameter-Feinschliff.