Zurück zu KI-Informationen
Gemeinsam mit CAISI×AISI: OpenAI macht ChatGPT-Agent und GPT-5-Sicherheitsbewertung "volljährig"

Gemeinsam mit CAISI×AISI: OpenAI macht ChatGPT-Agent und GPT-5-Sicherheitsbewertung "volljährig"

KI-Informationen Admin 59 Aufrufe

OpenAI kündigte die jüngsten Fortschritte in der Zusammenarbeit mit CAISI in den Vereinigten Staaten und AISI im Vereinigten Königreich an: gemeinsame Bewertung des Übels und End-to-End-Red-Teaming rund um ChatGPT Agent und GPT-5, Entdeckung und Behebung wichtiger Schwachstellen, Iteration bei Biosicherheits- und Produktsicherheits-Stacks und Demonstration eines neuen Paradigmas der kollaborativen Bewertung von ×RegierungIndustrie".


1. Schnelle Fakten

1. Layout und Zeitplan der Zusammenarbeit

Die Modellsicherheitsbewertung von OpenAI und CAISI, die mehr als ein Jahr dauerte, wurde auf "Proxy-Sicherheit" ausgeweitet; Die Biosicherheitskooperation mit AISI in Großbritannien wird seit Mai kontinuierlich für ChatGPT Agent und GPT-5 überarbeitet und deckt die gesamte Verbindung vom Modell zum Produkt ab.

2. Key Discovery (Agentensicherheit)

CAISI hat in einer gemeinsamen Übung im Juli zwei neue Arten von Schwachstellen identifiziert, die unter bestimmten Bedingungen umgangen und zu einer vollständigen Exploit-Kette kombiniert werden können. OpenAI akzeptiert den gleichen Tag und schließt die Reparatur und Rückgabe innerhalb eines Werktages ab, wodurch ein schneller geschlossener Kreislauf entsteht.

3. Biosicherheit AISI

reichte

mehr als zehn detaillierte Berichte über "Universal Jailbreak" und Überwachungsschwachstellen in der maßgeschneiderten Testumgebung von OpenAI ein, um das Patchen von Überwachungsstacks und Produktkonfigurationen zu fördern, die Wahrscheinlichkeit zu verringern, dass bösartige Inhalte umgangen werden, und die Sichtbarkeit von Warnungen zu verbessern.


2. Warum ist es wichtig?

1. Die Bewertung von "Pre-Launch" bis "Full Cycle"

ist nicht nur eine einzige Inspektion vor dem Start, sondern wird auch von der iterativen kontinuierlichen Verifizierung von ChatGPT Agent und GPT-5 begleitet, wobei der technische Rhythmus von "Discovery-Repair-Re-Test" betont wird.

2. Vertiefendes Modell der öffentlich-privaten Zusammenarbeit

Staatliche

Forschungseinrichtungen bringen Fachwissen in Netzwerksicherheit und nationalen Sicherheitsszenarien ein, und Unternehmen öffnen Systemkarten und Prototypumgebungen, und beide Seiten bilden einen technischen Konsens über reale Systeme, um die Sicherheitsbasis der Branche zu erhöhen.

3. Auswirkungen auf Entwickler und Unternehmen

Agenten gelten als eine Art "manipulierbarer automatisierter Client", der parallel zur traditionellen Web-/Terminalsicherheit entwickelt werden muss, um Routing, Anti-Escape und Verhaltensüberwachung aufzubauen.


3. Landinglist (kann direkt angewendet werden)

(1) Mindesteinstellung für die Agentensicherheit

a. Tool-Minimierung und Whitelist-Routing

b. Isolierung der Berechtigungs-Sandbox auf Sitzungsebene vom Dateisystem

c. Sekundäre Bestätigung und Aufzeichnung von Aktionen mit hohem Risiko

(2) Red Teaming und Beobachtbarkeit

a. Einführung von drei Arten von Skripten für "Proxy-Hijacking, Prompt Injection und Datenexfiltration"

b. Einrichtung einer Fehlerbeispieldatenbank und Wiederherstellung von Szenen

c. Schlüsselindikatoren: Abfangrate, Falsch-Positiv-Rate, Reparaturzeit

(3) Biosicherheits-Governance

a. Festlegen des Schutzschwellenwerts von domänen mit hoher Kapazität in Bezug auf die Systemkarte

b. Vorabladen von Richtlinienregeln auf die Abruf- und Tool-Schicht

c. Implementieren Sie eine hierarchische Implementierung und manuelle Überprüfung


von Anfragen mit hohem Risiko

4. Auswahlerinnerung für KI-Teams

1. Produkt-Stack

Für Szenarien der Automatisierung und des standortübergreifenden Betriebs sollte Modellen und Agenten mit "Systemkarte + externen Bewertungsdatensätzen" (wie z. B. ChatGPT Agent, GPT-5), um die Abstimmung von Audit und Compliance zu erleichtern.

2. Projekt-Stack

Schreiben Sie Red-Team-Ergebnisse in CI: Jedes Versionsupdate löst eine Jailbreak-Regression, eine Regression der Agent-Tool-Berechtigungen und eine Regression der Inhaltssicherheit aus.

3. Organisieren und koordinieren

Sie

Sicherheit, rechtliche Angelegenheiten und Produkte, um ein "Sicherheitsänderungsprotokoll" gemeinsam zu nutzen, um die Rückverfolgbarkeit von Erkennung, Reparatur und erneuten Tests zu erreichen.


Häufig gestellte Fragen (Q&A)

F: Was genau haben OpenAI, CAISI und AISI in dieser Runde der Zusammenarbeit getan?

A: Führen Sie gemeinsame Red-Teaming- und Systembewertungen rund um ChatGPT Agent und GPT-5 durch, um neue Schwachstellen auf Agentenebene zu finden und Korrekturen innerhalb eines Arbeitstages durchzuführen, während Sie gleichzeitig die Überwachung der Biosicherheit und den Schutz der Produktkonfiguration stärken.

F: Was ist der direkte Nutzen für Teams, die ChatGPT Agent oder GPT-5 verwenden?

A: Sie können die Erfahrung des tatsächlichen Kampfkonfrontationsstils und der Reparatur von CAISI und AISI übernehmen und Tests wie "Proxy-Hijacking, allgemeines Jailbreak und Content-Erpressung" in die Regression einbeziehen, um das Risiko von Produktionsunfällen zu verringern.

F: Wie wird die Systemkarte in der Entwicklung verwendet?

A: Verwenden Sie die Systemkarten von GPT-5 und ChatGPT Agent als "Sicherheitsfunktionshandbücher", um domänenkritische Schwellenwerte, Überwachungsindikatoren und Deaktivierungslisten in ausführbare Richtlinien und Testfälle umzuwandeln.

F: Reicht es aus, nur Penetrationstests vor dem Start durchzuführen?

A: Nicht genug. Beziehen Sie sich auf diese Zusammenarbeit für die "vollständige Zyklusbewertung": Version Graustufen - Wiederauftauchen des roten Teams - Regelimplementierung - Regressionsverifizierung und fahren Sie fort, die Angriffsfläche neuer Funktionen und neuer Tools abzudecken.

OpenAI ist eine Partnerschaft mit CAISI eingegangen OpenAI kooperiert mit AISI OpenAIChatGPTAgent Sicherheit OpenAI GPT-5 Sicherheitsbewertung OpenAI End-to-End-Red-Team OpenAI Joint Evil Assessment OpenAI Biosicherheits-Stack OpenAI-Produktsicherheits-Stack Verwendung der OpenAI-Systemkarte OpenAI Zusammenarbeit in der Regierungsbranche Best Practices für die Sicherheit von OpenAI-Agenten Schutz vor OpenAI-Proxy-Hijacking OpenAI-Eingabeaufforderungen sorgen für Konfrontation Schutz vor OpenAI-Datenexfiltration OpenAI-Jailbreak-Rückgabetest OpenAI behebt schnell den geschlossenen Kreislauf Optimierung des OpenAI-Monitoring-Stacks OpenAI Compliance & Auditing OpenAI Sicherheits-Änderungsprotokoll OpenAI Red Team Skript-Bibliothek OpenAI High Ability Domain-Schwellenwert Whitelist-Routing für OpenAI-Tools Isolation der OpenAI-Sitzungs-Sandbox Bestätigung der risikoreichen Aktion von OpenAI Metrik für die OpenAI-Abfangrate Überwachung der False-Positive-Rate von OpenAI OpenAI repariert Zeitindikatoren Überprüfung der OpenAI-Sicherheit über den gesamten Zyklus Die Version der Graustufenstrategie von OpenAI OpenAI Multi-Party-Datenkollaboration OpenAI-Richtlinienregeln sind vorne Schutz der OpenAI-Suchschicht OpenAIAgent Verhaltensüberwachung OpenAI Ende-zu-Ende-sichere Verbindung Rotes Team für Biosicherheit von OpenAI OpenAI-Evaluierungsmodell für die Regierung Die ökologische Landschaft von OpenAI wurde umgestaltet OpenAI Enterprise Security Auswahl OpenAICI integriert Red Teaming OpenAI Secure Routing Design OpenAIAgent-Downgrade-Richtlinie OpenAI sensitive Domain Rating Der manuelle Überprüfungsprozess von OpenAI OpenAI-Audits sind nachvollziehbar Richtlinien für die OpenAI-Sicherheitsgovernance Die offensiven und defensiven Fälle von OpenAI sind wieder aufgetaucht OpenAI Sicherheits-KPI-System Kartierung der Konformität von OpenAI-Systemkarten Mechanismus für die Zusammenarbeit im OpenAI-Team OpenAI Security Engineering gelandet

Empfohlene Tools

Mehr