Overfitting bedeutet, dass ein Modell seine Trainingsdaten zu gut auswendig lernt – inklusive Rauschen und zufälliger Details –, sodass es bei geübten Aufgaben glänzt, bei neuen, ungesehenen Daten aber deutlich einbricht. Ein Modell beurteilt man nicht an Fragen, die es trainiert hat, sondern daran, ob es die Regel auf frische Probleme anwenden kann. Ein überangepasstes Modell hat die Regel nicht gelernt. Es hat die Antworten memoriert.
Warum Trainingswerte und echtes Können auseinanderlaufen
Training ist im Kern die Suche nach Mustern in Daten. Doch Daten enthalten echte Muster und Rauschen zugleich: Eingabefehler, Zufälle, Eigenheiten, die nur in diesem Datensatz gelten. Je mehr Trainingsrunden und je mehr Parameter, desto mehr Kapazität hat das Modell, auch das Rauschen zu übernehmen. Das klassische Signal: Der Fehler auf den Trainingsdaten sinkt weiter, der Fehler auf Validierungsdaten sinkt erst und steigt dann wieder. Wo die beiden Kurven auseinanderlaufen, beginnt das Auswendiglernen.
Das Gegenstück ist Underfitting: Das Modell erfasst nicht einmal die Grundmuster und schneidet bei alten wie neuen Fragen schlecht ab. Ein gut trainiertes Modell liegt dazwischen. Vorsicht auch vor einer versteckten Ursache: Data Leakage, wenn Informationen, die erst beim Test auftauchen dürften, ins Training rutschen. Leakage erzeugt gefälschte Bestwerte, die schwerer zu erkennen sind als normales Overfitting, weil selbst die Testergebnisse glänzen.
Wann es am ehesten passiert
Erstens bei zu wenigen Daten für ein zu starkes Modell: Ein Schüler mit fotografischem Gedächtnis, der nur zehn Übungsaufgaben bekommt, scheitert, sobald eine Zahl geändert wird. Zweitens machen viele Wiederholungen derselben Daten das Modell auf Bekanntem glatt und auf leicht Abweichendem starr. Drittens wird verrauschtes, unsauberes Datenmaterial mitsamt falscher Labels als Regel gelernt. Beim Feintuning großer Modelle gilt dasselbe: Wenige Geschäftsbeispiele endlos wiederholt führen dazu, dass das Modell die Formulierungen der Beispiele kennt, nicht die Logik der Aufgabe.
Drei verbreitete Irrtümer
Erstens: Ein höherer Trainingswert bedeutet ein stärkeres Modell. Der Trainingswert zeigt nur, wie eng das Modell an diesem Datensatz klebt; jenseits eines Punktes kostet jede weitere Anpassung echte Verallgemeinerung. Deshalb vergleicht man Modelle an Testdaten, die nie am Training teilnahmen.
Zweitens: Nur kleine Modelle überanpassen sich. Das Gegenteil stimmt – mehr Parameter bedeuten mehr Gedächtniskapazität. Riesige Datenmengen verdünnen das Problem im Vortraining, doch beim Feintuning mit wenigen Daten ist Overfitting die erste Gefahr.
Drittens: Mehr Daten lösen das Problem von selbst. Sind die Zugänge nur Kopien und Umschreibungen desselben Inhalts und die Deduplizierung schlampig, trainiert das Modell dieselben Beispiele faktisch mehrfach. Zählen tut die Informationsmenge, nicht die Dateigröße.
Woran Laien ein auswendig lernendes Modell erkennen
Verändern Sie die Frage: Zahlen, Namen oder Reihenfolge tauschen oder eine Frage in zwei Schritte teilen. Wer beim Original glänzt und nach kleinen Änderungen einbricht, rezitiert statt zu schließen. Achten Sie auch auf den Umgang mit Unbekanntem: Inhalte ohne Training sollten angemessene Unsicherheit auslösen statt einer aufgezwungenen Schablone. Und vergleichen Sie Ranglistenruhm mit dem Alltag: Modelle, die Bestenlisten anführen und im täglichen Gebrauch stolpern, leiden oft unter starker Überschneidung von Test- und Trainingsdaten.
Wer Modelle auswählt oder feintunt, setzt auf unspektakuläre Mittel: Daten für eine Abschlussprüfung zurückhalten, die nie trainiert werden, die Validierungskurve beobachten und rechtzeitig stoppen, Daten sauber deduplizieren und bereinigen. Die Trennlinie – Muster lernen oder Antworten memorieren – entscheidet, wie viel Können übrig bleibt, wenn das Modell den Trainingsraum verlässt.