Knowledge Distillation ist eine Technik, mit der ein kleines Modell (das Schülermodell) von einem bereits trainierten großen Modell (dem Lehrermodell) lernt. Geoffrey Hinton und Kollegen haben sie 2015 in ihrem Paper „Distilling the Knowledge in a Neural Network" formalisiert. Das Ziel: Ein kleineres, schnelleres Modell soll möglichst viel vom Können des großen Modells übernehmen.
Der Kernmechanismus: Der Schüler lernt nicht die Antwort, sondern das „Zögern" des Lehrers
Normales Training nutzt nur „harte Labels": Dieses Bild zeigt eine Katze, also wird es als 100 % Katze gespeichert. Das Lehrermodell liefert dagegen „weiche Labels" – etwa: 70 % Katze, 20 % Tiger, 10 % etwas anderes. Hinton nannte diese Information „dark knowledge" (dunkles Wissen): Die Ähnlichkeitsbeziehungen zwischen den Klassen sind das, was der Lehrer wirklich gelernt hat.
Um diese schwachen Wahrscheinlichkeitssignale sichtbar zu machen, führt die Destillation einen Temperaturparameter T ein: Die Logits des Lehrers werden durch T geteilt, bevor Softmax angewendet wird. Je größer T, desto „weicher" die Verteilung – Nebenklassen, die bei 0,1 % klebten, werden angehoben, und der Schüler kann die Entscheidungsstruktur des Lehrers erkennen. Der Trainingsverlust des Schülers setzt sich gewichtet aus zwei Teilen zusammen: einer KL-Divergenz, die den weichen Lehrerlabels folgt, und dem üblichen Cross-Entropy-Verlust gegen die harten Labels.
Die Bausteine der Knowledge Distillation
Für eine vollständige Destillation braucht es vier Dinge: ein trainiertes Lehrermodell (meist ein großes Modell), ein zu trainierendes Schülermodell (eine kleine Architektur), den Temperaturparameter T und das Gewichtungsverhältnis zwischen weichem und hartem Verlust. Der Lehrer „stellt die Prüfung und liefert die Musterlösung", der Schüler sucht die Balance zwischen dem Nachahmen der Lehrerverteilung und der Treue zu den echten Labels.
Die Obergrenze der Destillation: Wann sie schlechter ist als direktes Training
Destillation ist kein Allheilmittel. Erstens setzt der Lehrer grob die Obergrenze des Schülers: Ist der Lehrer bei einer Aufgabe schwach, lernt der Schüler nur, „so falsch zu liegen wie der Lehrer". Zweitens kann ein Schüler mit zu geringer Kapazität „nicht lernen" – das Wissen des Lehrers passt nicht in ein winziges Netz. Drittens hat Destillation Vorlaufkosten: Für die weichen Labels muss erst einmal das große Lehrermodell laufen. Und viertens: Liegt die Zielaufgabe außerhalb der Stärkeverteilung des Lehrers, trainiert man das kleine Modell besser direkt auf den Zieldaten.
Drei verbreitete Irrtümer
Irrtum 1: Destillation ist Kompression, also dasselbe wie Quantisierung oder Pruning. Alle drei machen Modelle kleiner und schneller, aber Destillation findet in der Trainingsphase statt und überträgt Fähigkeiten; Quantisierung findet beim Deployment statt und senkt die numerische Präzision; Pruning löscht redundante Parameter. Man kann sie kombinieren (erst destillieren, dann quantisieren ist eine gängige Kombination), aber nicht gegenseitig ersetzen.
Irrtum 2: Der Schüler kann den Lehrer niemals übertreffen. Meist ist der Lehrer tatsächlich die Obergrenze, aber der Verlust mischt auch echte harte Labels bei, sodass ein auf Aufgabendaten feinabgestimmter Schüler einzelne Kennzahlen des Lehrers gelegentlich übertreffen kann.
Irrtum 3: Destillation ist verlustfrei. Fast jede Destillation kostet ein wenig Leistung; die Frage ist nur, wie viel und wo. Die Kehrseite von „behält 97 % der Leistung" ist, dass sich die fehlenden 3 % tendenziell im Long Tail und bei schwierigen Beispielen konzentrieren.
Wo liegen die Grenzen zwischen Destillation, Quantisierung und Pruning?
In einem Satz: Destillation ändert, „wie das Modell lernt", und erzeugt ein völlig neues kleines Modell; Quantisierung ändert, „wie Zahlen gespeichert werden", bei weitgehend unveränderter Architektur; Pruning ändert, „wie viel Struktur bleibt", indem Parameter direkt gelöscht werden. Sie wirken in verschiedenen Phasen des Modelllebenszyklus, treten oft gemeinsam auf, lösen aber unterschiedliche Probleme. Eine zugänglichere Version gibt es in unserem früheren Beitrag Modelldestillation: Warum immer mehr „kleine Modelle" zu großen aufschließen.
Echte Anwendungsszenarien
Das klassische Beispiel ist DistilBERT von HuggingFace: Mit BERT als Lehrer hat das Schülermodell 40 % weniger Parameter, ist 60 % schneller und behält rund 97 % des Sprachverständnisses. Auch das LLM-Zeitalter hat ein Vorzeigebeispiel: Das DeepSeek-R1-Team destillierte aus 800.000 von R1 erzeugten Reasoning-Beispielen das Modell DeepSeek-R1-Distill-Qwen-7B, das im Mathetest AIME 2024 eine Erfolgsquote von 55,5 % erreichte – deutlich über direkt trainierten Modellen gleicher Größe. Hinter den kleinen Modellen, die heute in Smartphone-Sprachfunktionen, On-Device-Kundenservice und Fahrzeugsystemen laufen, steckt meist Destillation.