ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Informationen
OpenAI meldet blockierte Distillation-Angriffe – Forscher stehlen Reasoning trotzdem auf Azure

OpenAI meldet blockierte Distillation-Angriffe – Forscher stehlen Reasoning trotzdem auf Azure

KI-Informationen • Admin • • 5 Aufrufe

Der Destillations-Schlagabtausch von OpenAI ist am 1. Oktober in eine peinliche zweite Runde gegangen. Laut einem Bericht von The Decoder an diesem Tag veröffentlichten unabhängige Forscher am selben Tag, an dem das Unternehmen einen Tag zuvor die Zerschlagung einer groß angelegten Modell-Destillations-Kampagne verkündet hatte, ein Update ihrer Studie: Dieselbe Diebstahlmethode funktioniere auf Microsoft Azure nach wie vor – selbst das verborgene Reasoning des frisch erschienenen GPT-6 Astra lasse sich Wort für Wort „stehlen".

Auslöser war OpenAIs offizieller Blogpost vom 30. September, „Disrupting a coordinated model-distillation campaign". Das Unternehmen legte offen, dass seit dem 1. Juli eine Gruppe mit Zehntausenden sorgfältig konstruierter Anfragen versucht habe, verborgenes internes Reasoning aus den Modellen zu extrahieren; am 24. und 25. Juli habe die Aktivität ihren Höhepunkt erreicht – 16.000 Anfragen mit Extraktionsmustern in zwei Tagen, von mehr als 4.000 Nutzern, verwandte Muster erstreckten sich über 15.000 Konten – und am 28. Juli vollständig gestoppt worden sei. OpenAI ordnete die Kerngruppe Personen zu, die mit Moonshot AI (dem Hersteller von Kimi) in Verbindung stehen, und stellte in einer Fußnote klar, dass die Zahlen Versuche zählten, nicht unbedingt Erfolge. Als Gegenmaßnahmen sperrte OpenAI betrügerische Konten, verschärfte die Registrierung, schloss den Kanal, über den verschlüsseltes Reasoning wiederverwendet werden konnte, und baute eine Leak-Erkennung in gestreamte Ausgaben ein. Diese Seite hatte über die Offenlegung bereits berichtet: OpenAI deckt Modell-Destillations-Angriff auf: 16.000 Extraktionsanfragen deuten auf Moonshot.

Nachtest: Die eigenen APIs hielten stand – Azure nicht

Das Drama spielte sich am Tag der Offenlegung ab. Das Team um Forscher Joachim Schaeffer aktualisierte auf stolen-thoughts.com seine Studie „Stealing Reasoning Traces from Proprietary LLM APIs" – mit einer Überschrift, die alles sagte: „We stole reasoning. Again." (Wir haben das Reasoning wieder gestohlen.)

Am 13. September testeten sie dieselbe Methode erneut: Auf den eigenen APIs von OpenAI und Anthropic war der Angriff inzwischen blockiert; auf Microsoft Azure jedoch fielen alle getesteten OpenAI-Modelle – einschließlich des neuen GPT-6 Astra – sowie Anthropic-Modelle bis Sonnet 5. Ein einziger Versuch genügte, um das Reasoning wortwörtlich zu extrahieren. In Schaeffers Worten: „Dieselben Modelle, aber völlig unterschiedlicher Schutz, je nachdem, welche Plattform sie ausliefert."

Ein noch einfacherer zweiter Weg: dem Modell einen „Notizblock" geben

Die Forscher legten außerdem eine zweite, noch einfachere Methode offen, demonstriert vom Entwickler Can Bölük: Man gibt dem Modell ein virtuelles „Notizblock"-Tool und weist es an, sein Reasoning dort aufzuschreiben – der Nutzer kann das Geschriebene anschließend lesen. Die Methode funktionierte bei allen OpenAI-Modellen sowie bei Opus 4.8 und Sonnet 5; nur Opus 5, Fable 5 und Fable 5.1 hielten stand. Die Ausgabe der Notizblock-Methode ähnele stark dem, was der Entschlüsselungsangriff liefere, und sei für Destillation „genauso nützlich", so die Forscher.

Warum die Patches immer zu spät kommen

Die Zeitachse erklärt die Peinlichkeit. GPT-6 Astra ging auf Drittplattformen ganz ohne Schutzmaßnahmen live; OpenAI fügte dem Azure-Endpunkt erst am 27. September Schutz hinzu – Tage nach dem Modellstart. Bei Anthropic ließ sich die Extraktion auf Azure erst ab dem 28. September nicht mehr reproduzieren.

Die Forscher bezeichnen die bisherigen Korrekturen als Stückwerk und oberflächlich: Viele Abwehrmaßnahmen seien brüchige Treffer gegen bestimmte Anfragemuster, und sie erreichten die Cloud-Plattformen oft erst Tage nach den Modellanbietern. Angreifer müssen nicht die stärkste Tür aufbrechen; sie müssen nur das schwächste Fenster finden.

Die Forderung der Forscher: Wer nicht mithält, soll keine Reasoning-Modelle hosten

Das Paper geht noch weiter: Patches müssten jede Angriffstechnik und jede Cloud abdecken, die die Modelle hostet – sonst wählten Angreifer immer die schwächste Route. Und darüber hinaus argumentieren die Forscher, Cloud-Anbieter ohne gleichwertigen Schutz dürften Reasoning-Modelle gar nicht erst hosten – denn offene Hintertüren würden es faktisch erlauben, Exportkontrollen auf API-Ebene zu umgehen.

OpenAIs Antwort darauf war das Eingeständnis, dass bei Partnern gehostete Modelle denselben Schutz bräuchten wie die eigenen Dienste – und dass „die Arbeit noch nicht abgeschlossen" sei.

Für Unternehmen, die Cloud-Reasoning-APIs tatsächlich nutzen, ist die Lehre konkret: Das Sicherheitsniveau des aufgerufenen Modells hängt nicht davon ab, wie viele Patches der Modellanbieter ausgeliefert hat, sondern davon, wie weit die eigene Cloud mitgekommen ist. Je stärker das Modell, desto wertvoller sein Reasoning – und desto mehr Leute wollen es „stehlen". Dieser Schlagabtausch hat gerade erst seine zweite Halbzeit begonnen.

Empfohlene Tools

Mehr