Am 30. September 2026 veröffentlichte OpenAI im offiziellen Blog einen Beitrag mit dem Titel „Disrupting a coordinated model-distillation campaign" und legte damit einen „adversarial distillation"-Angriff auf seine Modelle offen – und stoppte ihn. Seit dem 1. Juli hatten Angreifer mit Zehntausenden sorgfältig konstruierter Anfragen versucht, verborgene interne Schlussfolgerungen (Reasoning) aus den Modellen zu extrahieren; OpenAI ordnete den Kern der Aktivitäten Personen zu, die mit Moonshot AI (dem Entwickler von Kimi) in Verbindung stehen, und unterband die Kampagne am 28. Juli vollständig.
Gestohlen wurde nicht die Antwort, sondern der „Denkprozess"
Ziel des Angriffs waren nicht die Antworten der Modelle, sondern das, was OpenAI „protected reasoning" nennt – die interne Aufzeichnung, wie ein Modell eine Aufgabe durcharbeitet. Wer sie in Händen hält, kann die Fähigkeiten des Modells reproduzieren, Informationen ausgraben, die in der finalen Antwort bewusst zurückgehalten wurden, und damit eigene Modelle trainieren.
Die Methode war raffiniert: Die Angreifer kopierten verschlüsselte Schlussfolgerungen aus einer Konversation und baten das Modell in einer anderen Konversation, die verborgenen Inhalte zu „entschlüsseln und zu transkribieren". Weder wurde die Verschlüsselung gebrochen, noch eine Datenbank kompromittiert, noch echte Nutzerkonversationen gelesen – umgangen wurde der Interaktionsablauf selbst: Verschlüsselte Schlussfolgerungen erwiesen sich als portabel und zwischen Konversationen wiederabspielbar.
Die Kampagne begann Anfang Juli mit geringem Volumen und erreichte am 24. und 25. Juli ihren Höhepunkt: 16.000 Anfragen mit Extraktionsmerkmalen in zwei Tagen von mehr als 4.000 Nutzern; verwandte Prompt-Muster erstreckten sich auf über 15.000 Nutzer. In einer Fußnote stellt OpenAI klar, dass es sich dabei um „Versuche" handelt – nicht um zwangsläufig erfolgreiche Extraktionen.
Warum OpenAI das zur nationalen Sicherheit erklärt
Die Mitteilung klingt ernst: Extrahierte Schlussfolgerungen könnten zum Training eines anderen Modells verwendet werden, das die Sicherheitsleitplanken der Ausgaben des Originalmodells nicht erben würde. Massenhafte Destillation senkt die Kosten des „Fähigkeitstransfers", ohne die entsprechenden Sicherheitsinvestitionen mit zu übertragen – und je stärker Modelle in Dual-Use-Domänen wie Biologie und Chemie werden, desto mehr wird dieser „nackte Fähigkeitstransfer" zu einer Frage der nationalen Sicherheit.
Es ist auch kein Einzelfall. Eine diesen Sommer von Anthropic offengelegte, ähnliche Destillationskampagne gegen Claude deutete ebenfalls auf Moonshot AI. OpenAI bestätigte zudem verwandte Schwachstellen, die unabhängige Sicherheitsforscher per Responsible Disclosure gemeldet hatten, und teilte die Erkenntnisse über das Frontier Model Forum mit Branchenpartnern und staatlichen Informationskanälen – und stufte das Ganze damit als gemeinsame Bedrohung der Branche ein, nicht als eigene Hausaufgabe.
Wie OpenAI es stoppte – und worauf normale Nutzer achten sollten
OpenAI sperrte und beschränkte betrügerische Konten, härtete Registrierungs- und Infrastrukturkontrollen, schloss den „Replay"-Pfad für verschlüsselte Schlussfolgerungen und fügte eine Erkennung für gestreamte Ausgaben hinzu, die Reasoning preisgeben könnten; wo die Aktivität über Drittanbieter lief, wurde sie gemeinsam mit diesen unterbunden. Nur einen Tag vor dieser Offenlegung berichtete diese Seite über Am Vorabend des OpenAI-Sicherheitsvorfalls: Warnmails von Mitarbeitern Monate zuvor ignoriert – OpenAIs Sicherheitserzählung pendelt seit zwei Monaten zwischen „proaktiver Offenlegung" und „erzwungener Enthüllung".
Die Botschaft für normale Nutzer und Entwickler ist deutlich: Drittanbieter-Tools, die versprechen, die „verborgene Gedankenkette" eines Modells freizuschalten, bewegen sich technisch auf derselben Route wie dieser Angriff – wer sie nutzt, speist sein eigenes Konto in die nachgelagerte Kette dieser Grauzone ein.
Auf einer tieferen Ebene legte der Vorfall einen Riss im Burggraben der Frontier-Labore offen: Die Reasoning-Verschlüsselung selbst wurde nie gebrochen; gebrochen wurde die Designannahme, dass „verschlüsselte Schlussfolgerungen zwischen Konversationen fließen dürfen". Künftige Abwehr darf nicht nur den Ausgabetext beobachten – sie muss die gesamte Aufrufkette im Blick haben. Das Wettrüsten um Destillation wird nur noch raffinierter.