OpenAI 公布与美国 CAISI、英国 AISI 的最新合作进展:围绕 ChatGPT Agent 与 GPT-5 开展联合作恶评估与端到端红队,发现并修复关键漏洞,迭代生物安全与产品安全栈,示范“政府×产业”协作评测的新范式。
一、要点速览
1、合作版图与时间线
OpenAI 与 CAISI 持续一年以上的模型安全评估扩展到“代理安全”;与英国 AISI 的生物安全合作自五月起对 ChatGPT Agent 与 GPT-5 进行连续红队,覆盖从模型到产品全链路。
2、关键发现(Agent 安全)
CAISI 在七月的联合演练中识别两类新型漏洞,在特定条件下可绕过保护并组合为完整利用链;OpenAI 当日受理并在一个工作日内完成修复与回归,形成快速闭环。
3、生物安全栈(Biosecurity)
英国 AISI 在 OpenAI 的定制测试环境下,针对“通用越狱”与监控漏洞提交十余份详细报告,推动监控栈与产品配置修补,降低恶意内容绕过概率并提升告警可见性。
二、为什么重要
1、评测从“上线前”走向“全周期”
不仅是单次上架前检查,而是伴随 ChatGPT Agent、GPT-5 的迭代持续验证,强调“发现—修复—复测”的工程节奏。
2、公私协作的深度样板
政府研究机构贡献网络安全与国安场景专长,企业开放系统卡与原型环境,双方在真实系统上形成技术共识,抬高行业安全基线。
3、对开发者与企业的启示
把 Agent 视作一类“可被操纵的自动化客户端”,需要与传统 Web/端安全并行建设路由、防逃逸与行为监控。
三、落地清单(可直接套用)
(1)Agent 安全最小集
a. 工具最小化与白名单路由
b. 会话级权限沙箱与文件系统隔离
c. 高风险动作二次确认与记录
(2)红队与可观测
a. 引入“代理劫持、提示注入、数据外流”三类脚本
b. 建立失败样例库与复现场景
c. 关键指标:拦截率、误报率、修复用时
(3)生物安全治理
a. 参考系统卡设定高能力域的防护阈值
b. 将政策规则前置到检索与工具层
c. 对高危请求实施分级落地与人工复核
四、对 AI 团队的选型提醒
1、产品栈
面向自动化与跨站操作的场景优先选具备“系统卡+外部评测记录”的模型与 Agent(如 ChatGPT Agent、GPT-5),便于对齐审计与合规。
2、工程栈
把红队结果写入 CI:每次版本更新触发越狱回归、Agent 工具权限回归与内容安全回归。
3、组织协同
安全、法务、产品共用一个“安全变更日志”,做到发现、修复、复测可追溯。
常见问题解答(Q&A)
Q:OpenAI 与 CAISI、AISI 的这轮合作到底做了什么?
A:围绕 ChatGPT Agent 与 GPT-5,开展联合红队与系统评测,发现代理层面的新型漏洞并在一个工作日内完成修复,同时加强生物安全监控与产品配置防护。
Q:对正在用 ChatGPT Agent 或 GPT-5 的团队有何直接价值?
A:你能继承来自 CAISI、AISI 的实战化对抗样式与修复经验,把“代理劫持、通用越狱、内容外流”等测试纳入回归,降低生产事故风险。
Q:系统卡(System Card)在工程上怎么用?
A:将 GPT-5 与 ChatGPT Agent 的系统卡作为“安全功能说明书”,把高能力域阈值、监控指标与禁用清单转成可执行的策略与测试用例。
Q:仅做上线前渗透测试是否足够?
A:不够。参考本次合作做“全周期评测”:版本灰度—红队复现—规则落地—回归验证,持续覆盖新功能与新工具的攻击面。