OpenAI kündigte die jüngsten Fortschritte in der Zusammenarbeit mit CAISI in den Vereinigten Staaten und AISI im Vereinigten Königreich an: gemeinsame Bewertung des Übels und End-to-End-Red-Teaming rund um ChatGPT Agent und GPT-5, Entdeckung und Behebung wichtiger Schwachstellen, Iteration bei Biosicherheits- und Produktsicherheits-Stacks und Demonstration eines neuen Paradigmas der kollaborativen Bewertung von ×RegierungIndustrie".
1. Schnelle Fakten
1. Layout und Zeitplan der Zusammenarbeit
Die Modellsicherheitsbewertung von OpenAI und CAISI, die mehr als ein Jahr dauerte, wurde auf "Proxy-Sicherheit" ausgeweitet; Die Biosicherheitskooperation mit AISI in Großbritannien wird seit Mai kontinuierlich für ChatGPT Agent und GPT-5 überarbeitet und deckt die gesamte Verbindung vom Modell zum Produkt ab.
2. Key Discovery (Agentensicherheit)
CAISI hat in einer gemeinsamen Übung im Juli zwei neue Arten von Schwachstellen identifiziert, die unter bestimmten Bedingungen umgangen und zu einer vollständigen Exploit-Kette kombiniert werden können. OpenAI akzeptiert den gleichen Tag und schließt die Reparatur und Rückgabe innerhalb eines Werktages ab, wodurch ein schneller geschlossener Kreislauf entsteht.
3. Biosicherheit AISI
reichtemehr als zehn detaillierte Berichte über "Universal Jailbreak" und Überwachungsschwachstellen in der maßgeschneiderten Testumgebung von OpenAI ein, um das Patchen von Überwachungsstacks und Produktkonfigurationen zu fördern, die Wahrscheinlichkeit zu verringern, dass bösartige Inhalte umgangen werden, und die Sichtbarkeit von Warnungen zu verbessern.
2. Warum ist es wichtig?
1. Die Bewertung von "Pre-Launch" bis "Full Cycle"
ist nicht nur eine einzige Inspektion vor dem Start, sondern wird auch von der iterativen kontinuierlichen Verifizierung von ChatGPT Agent und GPT-5 begleitet, wobei der technische Rhythmus von "Discovery-Repair-Re-Test" betont wird.
2. Vertiefendes Modell der öffentlich-privaten Zusammenarbeit
StaatlicheForschungseinrichtungen bringen Fachwissen in Netzwerksicherheit und nationalen Sicherheitsszenarien ein, und Unternehmen öffnen Systemkarten und Prototypumgebungen, und beide Seiten bilden einen technischen Konsens über reale Systeme, um die Sicherheitsbasis der Branche zu erhöhen.
3. Auswirkungen auf Entwickler und Unternehmen
Agenten gelten als eine Art "manipulierbarer automatisierter Client", der parallel zur traditionellen Web-/Terminalsicherheit entwickelt werden muss, um Routing, Anti-Escape und Verhaltensüberwachung aufzubauen.
3. Landinglist (kann direkt angewendet werden)
(1) Mindesteinstellung für die Agentensicherheit
a. Tool-Minimierung und Whitelist-Routing
b. Isolierung der Berechtigungs-Sandbox auf Sitzungsebene vom Dateisystem
c. Sekundäre Bestätigung und Aufzeichnung von Aktionen mit hohem Risiko
(2) Red Teaming und Beobachtbarkeit
a. Einführung von drei Arten von Skripten für "Proxy-Hijacking, Prompt Injection und Datenexfiltration"
b. Einrichtung einer Fehlerbeispieldatenbank und Wiederherstellung von Szenen
c. Schlüsselindikatoren: Abfangrate, Falsch-Positiv-Rate, Reparaturzeit
(3) Biosicherheits-Governance
a. Festlegen des Schutzschwellenwerts von domänen mit hoher Kapazität in Bezug auf die Systemkarte
b. Vorabladen von Richtlinienregeln auf die Abruf- und Tool-Schicht
c. Implementieren Sie eine hierarchische Implementierung und manuelle Überprüfung
4. Auswahlerinnerung für KI-Teams
1. Produkt-Stack
Für Szenarien der Automatisierung und des standortübergreifenden Betriebs sollte Modellen und Agenten mit "Systemkarte + externen Bewertungsdatensätzen" (wie z. B. ChatGPT Agent, GPT-5), um die Abstimmung von Audit und Compliance zu erleichtern.
2. Projekt-Stack
Schreiben Sie Red-Team-Ergebnisse in CI: Jedes Versionsupdate löst eine Jailbreak-Regression, eine Regression der Agent-Tool-Berechtigungen und eine Regression der Inhaltssicherheit aus.
3. Organisieren und koordinieren
SieSicherheit, rechtliche Angelegenheiten und Produkte, um ein "Sicherheitsänderungsprotokoll" gemeinsam zu nutzen, um die Rückverfolgbarkeit von Erkennung, Reparatur und erneuten Tests zu erreichen.
Häufig gestellte Fragen (Q&A)
F: Was genau haben OpenAI, CAISI und AISI in dieser Runde der Zusammenarbeit getan?
A: Führen Sie gemeinsame Red-Teaming- und Systembewertungen rund um ChatGPT Agent und GPT-5 durch, um neue Schwachstellen auf Agentenebene zu finden und Korrekturen innerhalb eines Arbeitstages durchzuführen, während Sie gleichzeitig die Überwachung der Biosicherheit und den Schutz der Produktkonfiguration stärken.
F: Was ist der direkte Nutzen für Teams, die ChatGPT Agent oder GPT-5 verwenden?
A: Sie können die Erfahrung des tatsächlichen Kampfkonfrontationsstils und der Reparatur von CAISI und AISI übernehmen und Tests wie "Proxy-Hijacking, allgemeines Jailbreak und Content-Erpressung" in die Regression einbeziehen, um das Risiko von Produktionsunfällen zu verringern.
F: Wie wird die Systemkarte in der Entwicklung verwendet?
A: Verwenden Sie die Systemkarten von GPT-5 und ChatGPT Agent als "Sicherheitsfunktionshandbücher", um domänenkritische Schwellenwerte, Überwachungsindikatoren und Deaktivierungslisten in ausführbare Richtlinien und Testfälle umzuwandeln.
F: Reicht es aus, nur Penetrationstests vor dem Start durchzuführen?
A: Nicht genug. Beziehen Sie sich auf diese Zusammenarbeit für die "vollständige Zyklusbewertung": Version Graustufen - Wiederauftauchen des roten Teams - Regelimplementierung - Regressionsverifizierung und fahren Sie fort, die Angriffsfläche neuer Funktionen und neuer Tools abzudecken.