ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Informationen
Entlassene OpenAI-Forscher schreiben an den Vorstand: Chain-of-Thought-Monitoring darf nicht weiter zurückfallen

Entlassene OpenAI-Forscher schreiben an den Vorstand: Chain-of-Thought-Monitoring darf nicht weiter zurückfallen

KI-Informationen • Admin • • 11 Aufrufe

Drei entlassene Sicherheitsforscher von OpenAI haben am 7. Oktober 2026 einen Brief an den Vorstand und die Sicherheitsgremien des Unternehmens geschickt; Auszüge wurden am 8. Oktober unter anderem vom Wall Street Journal veröffentlicht. Die drei — Jasmine Wang, Tomek Korbak und Mikita Balesni — stammen alle aus Teams für Sicherheit und Alignment. OpenAI hatte sich am 1. Oktober wegen Verstößen gegen die Regeln zum Umgang mit sensiblen Informationen von ihnen getrennt, nannte aber weder Namen noch die beteiligte externe Organisation. Der Brief tut zweierlei zugleich: Er verteidigt ihr Verhalten und stellt eine konkrete technische Forderung an das Unternehmen.

Zunächst die Darstellungen beider Seiten

In dem Brief und in öffentlichen Beiträgen sagen die drei, ihre Außenkontakte hätten innerhalb ihrer Aufgaben gelegen. Korbak gibt an, er sei während der Untersuchung des Hugging-Face-Vorfalls der technische Ansprechpartner für die Bewertungsorganisation METR gewesen, als das Unternehmen noch Verfahren für eine beispiellose Untersuchung entwickelte. Balesni sagt, die von ihm koordinierte unternehmensübergreifende Arbeit zur Überwachbarkeit sei vorab an seine Berichtslinie gemeldet worden, und er habe sensible Details vor der Weitergabe entfernt. Wang schrieb am 8. Oktober, sie habe eine sensible E-Mail einer Führungskraft versehentlich geöffnet, weil ein für die Personalgewinnung gewährter Postfachzugriff trotz ihres Widerrufsantrags von der IT nicht entfernt worden sei; sie habe die Führungskraft innerhalb weniger Minuten informiert und erneut um Entfernung gebeten. Die drei bestreiten außerdem, die Quelle eines Medienberichts über schwerer überwachbare Architekturen zu sein. All das sind Darstellungen der Betroffenen; der Brief ist nicht vollständig veröffentlicht, und die Details lassen sich nicht unabhängig prüfen.

Die eigentliche Forderung: die Gedankenkette überwachbar halten

Die technische Forderung des Briefs ist präzise: Die Branche wisse noch nicht, wie sich Modelle, die man nicht überwachen kann, sicher entwickeln und einsetzen lassen, und Frontier-Unternehmen sollten keine Entwicklungen vorantreiben, die die Überwachbarkeit der Gedankenkette weiter schwächen. Außerdem fordern sie, mit externen Prüfern zusammenzuarbeiten und ein offenes, transparentes Sicherheitsökosystem zu unterstützen, und schreiben, die Entlassungen verunsicherten die verbleibenden Mitarbeiter. Ein OpenAI-Sprecher erklärte, die Trennungen hätten nichts mit dem Äußern von Sicherheitsbedenken zu tun, und teilte einen Auszug aus einem internen Memo eines Forschungsleiters vom 8. Oktober, das den Empfehlungen des Briefs nachdrücklich zustimmte. Bemerkenswert: Die System Card von GPT-6 Astra räumt bereits ein, dass seine Gedankenkette schwerer zu überwachen ist als die des Vorgängers — genau die Richtung, vor der die drei warnen.

Wenn die Regeln ungeschrieben sind, kollidieren Geheimhaltung und Zusammenarbeit

Was andere Labore daraus lernen sollten, ist nicht, wer recht hat, sondern wo die Grenze verläuft. Sicherheitsforschung braucht von Natur aus den Austausch mit externen Prüfern, während Geheimhaltungspflichten jede Weitergabe verbieten. Wird die Linie nur nachträglich durch Untersuchungen gezogen, fragt sich jeder Forscher bei legitimer Zusammenarbeit zuerst, ob sie zum Material der nächsten Untersuchung werden könnte. Die drei verlangen, die Regeln für Außenarbeit schriftlich festzuhalten. Wenn das Unternehmen den technischen Rat des Briefs wirklich teilt, wäre die praktische Antwort, offenzulegen, was erlaubt ist, was nicht und an wen man sich zur Meldung wendet — und die Verfahren externer Prüfung zu benennen. Sonst erodiert womöglich zuerst nicht das Monitoring der Gedankenkette, sondern die Bereitschaft, intern überhaupt noch Bedenken zu äußern.

Empfohlene Tools

Mehr