Retour à Informations sur l’IA
Joignez-vous à CAISI×AISI : OpenAI fait de l’agent ChatGPT et de l’évaluation de la sécurité GPT-5 un « cycle complet »

Joignez-vous à CAISI×AISI : OpenAI fait de l’agent ChatGPT et de l’évaluation de la sécurité GPT-5 un « cycle complet »

Informations sur l’IA Admin 59 vues

OpenAI a annoncé les derniers progrès de sa coopération avec CAISI aux États-Unis et AISI au Royaume-Uni : une évaluation conjointe du mal et une équipe rouge de bout en bout autour de ChatGPT Agent et GPT-5, la découverte et la correction de vulnérabilités clés, l’itération sur la biosécurité et les piles de sécurité des produits, et la démonstration d’un nouveau paradigme d’évaluation collaborative « gouvernement×industrie ».


1. Faits en bref

1. Coopération Structure et chronologie

L’évaluation de la sécurité du modèle OpenAI et CAISI, qui a duré plus d’un an, a été étendue à la « sécurité proxy » ; Depuis mai, la coopération en matière de biosécurité avec l’AISI au Royaume-Uni a été continuellement renforcée pour ChatGPT Agent et GPT-5, couvrant l’ensemble du lien, du modèle au produit.

2. Key Discovery (Agent Security)

CAISI a identifié deux nouveaux types de vulnérabilités lors d’un exercice conjoint en juillet, qui peuvent être contournées et combinées en une chaîne d’exploitation complète dans des conditions spécifiques. OpenAI accepte le jour même et termine la réparation et le retour dans un délai d’un jour ouvrable, formant ainsi une boucle fermée rapide.

3. Biosécurité AISI

a soumis

plus de dix rapports détaillés sur le « jailbreak universel » et la surveillance des vulnérabilités dans l’environnement de test personnalisé d’OpenAI, promouvant la surveillance de la pile et des correctifs de configuration du produit, réduisant la probabilité de contournement du contenu malveillant et améliorant la visibilité des alertes.


2. Pourquoi est-ce important

1. L’évaluation du « pré-lancement » au « cycle complet »

n’est pas seulement une inspection unique avant le lancement, mais également accompagnée de la vérification continue itérative de l’agent ChatGPT et de GPT-5, en mettant l’accent sur le rythme d’ingénierie de « découverte-réparation-re-test ».

2. Modèle approfondi de collaboration public-privé Les

institutions de

recherche gouvernementales apportent leur expertise dans les scénarios de sécurité des réseaux et de sécurité nationale, et les entreprises ouvrent des cartes système et des environnements prototypes, et les deux parties forment un consensus technique sur les systèmes réels pour élever la base de sécurité de l’industrie.

3. Implications pour les développeurs et les entreprises

Les agents sont considérés comme un type de « client automatisé manipulable » qui doit être construit en parallèle avec la sécurité traditionnelle des web/terminaux pour construire le routage, l’anti-évasion et la surveillance du comportement.


3. Liste d’atterrissage (peut être appliquée directement)

(1) Définition minimale de sécurité de l’agent

a. Minimisation de l’outil et routage de la liste blanche

b. Isolation du bac à sable d’autorisation au niveau de la session par rapport au système de fichiers

c. Confirmation secondaire et enregistrement des actions à haut risque

(2) Red teaming et observabilité

a. Introduire trois types de scripts : « détournement de proxy, injection d’invites et exfiltration de données »

b. Établir une base de données d’échantillons d’échec et restaurer les scènes

c. Indicateurs clés : taux d’interception, taux de faux positifs, temps de réparation

(3) Gouvernance de la biosécurité

a. Définir le seuil de protection des domaines à haute capacité en référence à la carte système

b. Précharger les règles de politique dans la couche

de récupération et d’outil c. Mettre en œuvre une mise en œuvre hiérarchique et un examen


manuel des demandes à haut risque

4. Rappel de sélection pour les équipes d’IA

1. Pile de produits

Pour les scénarios d’automatisation et de fonctionnement intersite, la priorité doit être donnée aux modèles et aux agents avec « carte système + enregistrements d’évaluation externes » (tels que ChatGPT Agent, GPT-5) afin de faciliter l’harmonisation de la vérification et de la conformité.

2. Pile de projet

Écrivez les résultats de l’équipe rouge à la CI : chaque mise à jour de version déclenche une régression de jailbreak, une régression des permissions de l’outil d’agent et une régression de la sécurité du contenu.

3. Organisez et coordonnez

la sécurité, les affaires juridiques et les produits pour partager un « journal des modifications de sécurité » afin d’assurer la traçabilité de la découverte, de la réparation et de la reprise des tests.


Foire aux questions Q :

Qu’ont fait exactement OpenAI, CAISI et AISI dans ce cycle de coopération ?

R : Effectuez des évaluations conjointes des équipes rouges et des évaluations du système autour de ChatGPT Agent et de GPT-5 pour trouver de nouvelles vulnérabilités au niveau de l’agent et effectuer les corrections en un jour ouvrable, tout en renforçant la surveillance de la biosécurité et la protection de la configuration du produit.

Q : Quelle est la valeur directe pour les équipes utilisant ChatGPT Agent ou GPT-5 ?

R : Vous pouvez hériter de l’expérience du style de confrontation et de réparation de combat réel de CAISI et AISI, et incorporer des tests tels que le « détournement de proxy, le jailbreak général et l’extorsion de contenu » dans la régression pour réduire le risque d’accidents de production.

Q : Comment la carte système est-elle utilisée dans l’ingénierie ?

R : Utilisez les cartes système de GPT-5 et de ChatGPT Agent comme « manuels de fonction de sécurité » pour convertir les seuils de domaine à haute capacité, les indicateurs de surveillance et les listes de désactivation en politiques exécutables et en cas de test.

Q : Est-il suffisant de ne faire que des tests d’intrusion avant le lancement ?

R : Pas assez. Reportez-vous à cette coopération pour une « évaluation du cycle complet » : version niveaux de gris - réapparition de l’équipe rouge - implémentation de règles - vérification de régression, et continuez à couvrir la surface d’attaque de nouvelles fonctionnalités et de nouveaux outils.

OpenAI s’est associé à CAISI OpenAI s’associe à AISI OpenAIChatGPTAsécurité douce Évaluation de la sécurité OpenAI GPT-5 L’équipe rouge de bout en bout d’OpenAI Évaluation conjointe du mal d’OpenAI Pile de biosécurité OpenAI Pile de sécurité des produits OpenAI Utilisation de la carte système OpenAI Collaboration OpenAI entre le gouvernement et l’industrie Meilleures pratiques de sécurité de l’agent OpenAI Protection contre le détournement de proxy OpenAI OpenAI incite à la confrontation Protection contre l’exfiltration de données OpenAI Test de retour de jailbreak OpenAI OpenAI corrige rapidement la boucle fermée Optimisation de la pile de surveillance OpenAI Conformité et audit OpenAI Journal des modifications de la sécurité OpenAI Bibliothèque de scripts OpenAI Red Team Seuil de domaine à haute capacité OpenAI Routage de la liste blanche de l’outil OpenAI Isolation du bac à sable de session OpenAI Confirmation de l’action à haut risque d’OpenAI Mesure du taux d’interception OpenAI Surveillance du taux de faux positifs OpenAI OpenAI répare les indicateurs de temps Examen complet du cycle de sécurité OpenAI La version d’OpenAI de la stratégie en niveaux de gris Collaboration multipartite OpenAI sur les données Les règles de politique OpenAI sont à l’avant Protection de la couche de recherche OpenAI OpenAIAgent surveillance du comportement Lien sécurisé de bout en bout OpenAI Équipe rouge de la biosécurité OpenAI Modèle d’évaluation gouvernementale OpenAI Le paysage écologique d’OpenAI a été remodelé Sélection de la sécurité d’OpenAI Enterprise OpenAICI intègre le red teaming Conception de routage sécurisé OpenAI Politique de rétrogradation OpenAIAgent Classement des domaines sensibles OpenAI Processus d’examen manuel d’OpenAI Les audits OpenAI sont traçables Directives de gouvernance de la sécurité OpenAI Les cas offensifs et défensifs d’OpenAI sont réapparus Système KPI de sécurité OpenAI Cartographie de la conformité des cartes système OpenAI Mécanisme de collaboration d’équipe OpenAI L’ingénierie de sécurité d’OpenAI a atterri

Outils Recommandés

Plus