OpenAI a annoncé les derniers progrès de sa coopération avec CAISI aux États-Unis et AISI au Royaume-Uni : une évaluation conjointe du mal et une équipe rouge de bout en bout autour de ChatGPT Agent et GPT-5, la découverte et la correction de vulnérabilités clés, l’itération sur la biosécurité et les piles de sécurité des produits, et la démonstration d’un nouveau paradigme d’évaluation collaborative « gouvernement×industrie ».
1. Faits en bref
1. Coopération Structure et chronologie
L’évaluation de la sécurité du modèle OpenAI et CAISI, qui a duré plus d’un an, a été étendue à la « sécurité proxy » ; Depuis mai, la coopération en matière de biosécurité avec l’AISI au Royaume-Uni a été continuellement renforcée pour ChatGPT Agent et GPT-5, couvrant l’ensemble du lien, du modèle au produit.
2. Key Discovery (Agent Security)
CAISI a identifié deux nouveaux types de vulnérabilités lors d’un exercice conjoint en juillet, qui peuvent être contournées et combinées en une chaîne d’exploitation complète dans des conditions spécifiques. OpenAI accepte le jour même et termine la réparation et le retour dans un délai d’un jour ouvrable, formant ainsi une boucle fermée rapide.
3. Biosécurité AISI
a soumisplus de dix rapports détaillés sur le « jailbreak universel » et la surveillance des vulnérabilités dans l’environnement de test personnalisé d’OpenAI, promouvant la surveillance de la pile et des correctifs de configuration du produit, réduisant la probabilité de contournement du contenu malveillant et améliorant la visibilité des alertes.
2. Pourquoi est-ce important
1. L’évaluation du « pré-lancement » au « cycle complet »
n’est pas seulement une inspection unique avant le lancement, mais également accompagnée de la vérification continue itérative de l’agent ChatGPT et de GPT-5, en mettant l’accent sur le rythme d’ingénierie de « découverte-réparation-re-test ».
2. Modèle approfondi de collaboration public-privé Les
institutions derecherche gouvernementales apportent leur expertise dans les scénarios de sécurité des réseaux et de sécurité nationale, et les entreprises ouvrent des cartes système et des environnements prototypes, et les deux parties forment un consensus technique sur les systèmes réels pour élever la base de sécurité de l’industrie.
3. Implications pour les développeurs et les entreprises
Les agents sont considérés comme un type de « client automatisé manipulable » qui doit être construit en parallèle avec la sécurité traditionnelle des web/terminaux pour construire le routage, l’anti-évasion et la surveillance du comportement.
3. Liste d’atterrissage (peut être appliquée directement)
(1) Définition minimale de sécurité de l’agent
a. Minimisation de l’outil et routage de la liste blanche
b. Isolation du bac à sable d’autorisation au niveau de la session par rapport au système de fichiers
c. Confirmation secondaire et enregistrement des actions à haut risque
(2) Red teaming et observabilité
a. Introduire trois types de scripts : « détournement de proxy, injection d’invites et exfiltration de données »
b. Établir une base de données d’échantillons d’échec et restaurer les scènes
c. Indicateurs clés : taux d’interception, taux de faux positifs, temps de réparation
(3) Gouvernance de la biosécurité
a. Définir le seuil de protection des domaines à haute capacité en référence à la carte système
b. Précharger les règles de politique dans la couche
de récupération et d’outil c. Mettre en œuvre une mise en œuvre hiérarchique et un examen
4. Rappel de sélection pour les équipes d’IA
1. Pile de produits
Pour les scénarios d’automatisation et de fonctionnement intersite, la priorité doit être donnée aux modèles et aux agents avec « carte système + enregistrements d’évaluation externes » (tels que ChatGPT Agent, GPT-5) afin de faciliter l’harmonisation de la vérification et de la conformité.
2. Pile de projet
Écrivez les résultats de l’équipe rouge à la CI : chaque mise à jour de version déclenche une régression de jailbreak, une régression des permissions de l’outil d’agent et une régression de la sécurité du contenu.
3. Organisez et coordonnez
la sécurité, les affaires juridiques et les produits pour partager un « journal des modifications de sécurité » afin d’assurer la traçabilité de la découverte, de la réparation et de la reprise des tests.
Foire aux questions Q :
Qu’ont fait exactement OpenAI, CAISI et AISI dans ce cycle de coopération ?
R : Effectuez des évaluations conjointes des équipes rouges et des évaluations du système autour de ChatGPT Agent et de GPT-5 pour trouver de nouvelles vulnérabilités au niveau de l’agent et effectuer les corrections en un jour ouvrable, tout en renforçant la surveillance de la biosécurité et la protection de la configuration du produit.
Q : Quelle est la valeur directe pour les équipes utilisant ChatGPT Agent ou GPT-5 ?
R : Vous pouvez hériter de l’expérience du style de confrontation et de réparation de combat réel de CAISI et AISI, et incorporer des tests tels que le « détournement de proxy, le jailbreak général et l’extorsion de contenu » dans la régression pour réduire le risque d’accidents de production.
Q : Comment la carte système est-elle utilisée dans l’ingénierie ?
R : Utilisez les cartes système de GPT-5 et de ChatGPT Agent comme « manuels de fonction de sécurité » pour convertir les seuils de domaine à haute capacité, les indicateurs de surveillance et les listes de désactivation en politiques exécutables et en cas de test.
Q : Est-il suffisant de ne faire que des tests d’intrusion avant le lancement ?
R : Pas assez. Reportez-vous à cette coopération pour une « évaluation du cycle complet » : version niveaux de gris - réapparition de l’équipe rouge - implémentation de règles - vérification de régression, et continuez à couvrir la surface d’attaque de nouvelles fonctionnalités et de nouveaux outils.