返回AI资讯
联手 CAISI×AISI:OpenAI 把 ChatGPT Agent 与 GPT-5 的安全评测做成“全周期”

联手 CAISI×AISI:OpenAI 把 ChatGPT Agent 与 GPT-5 的安全评测做成“全周期”

AI资讯 Admin 59 次浏览

OpenAI 公布与美国 CAISI、英国 AISI 的最新合作进展:围绕 ChatGPT Agent 与 GPT-5 开展联合作恶评估与端到端红队,发现并修复关键漏洞,迭代生物安全与产品安全栈,示范“政府×产业”协作评测的新范式。


一、要点速览

1、合作版图与时间线

OpenAI 与 CAISI 持续一年以上的模型安全评估扩展到“代理安全”;与英国 AISI 的生物安全合作自五月起对 ChatGPT Agent 与 GPT-5 进行连续红队,覆盖从模型到产品全链路。

2、关键发现(Agent 安全)

CAISI 在七月的联合演练中识别两类新型漏洞,在特定条件下可绕过保护并组合为完整利用链;OpenAI 当日受理并在一个工作日内完成修复与回归,形成快速闭环。

3、生物安全栈(Biosecurity)

英国 AISI 在 OpenAI 的定制测试环境下,针对“通用越狱”与监控漏洞提交十余份详细报告,推动监控栈与产品配置修补,降低恶意内容绕过概率并提升告警可见性。


二、为什么重要

1、评测从“上线前”走向“全周期”

不仅是单次上架前检查,而是伴随 ChatGPT Agent、GPT-5 的迭代持续验证,强调“发现—修复—复测”的工程节奏。

2、公私协作的深度样板

政府研究机构贡献网络安全与国安场景专长,企业开放系统卡与原型环境,双方在真实系统上形成技术共识,抬高行业安全基线。

3、对开发者与企业的启示

把 Agent 视作一类“可被操纵的自动化客户端”,需要与传统 Web/端安全并行建设路由、防逃逸与行为监控。


三、落地清单(可直接套用)

(1)Agent 安全最小集

a. 工具最小化与白名单路由

b. 会话级权限沙箱与文件系统隔离

c. 高风险动作二次确认与记录

(2)红队与可观测

a. 引入“代理劫持、提示注入、数据外流”三类脚本

b. 建立失败样例库与复现场景

c. 关键指标:拦截率、误报率、修复用时

(3)生物安全治理

a. 参考系统卡设定高能力域的防护阈值

b. 将政策规则前置到检索与工具层

c. 对高危请求实施分级落地与人工复核


四、对 AI 团队的选型提醒

1、产品栈

面向自动化与跨站操作的场景优先选具备“系统卡+外部评测记录”的模型与 Agent(如 ChatGPT Agent、GPT-5),便于对齐审计与合规。

2、工程栈

把红队结果写入 CI:每次版本更新触发越狱回归、Agent 工具权限回归与内容安全回归。

3、组织协同

安全、法务、产品共用一个“安全变更日志”,做到发现、修复、复测可追溯。


常见问题解答(Q&A)

Q:OpenAI 与 CAISI、AISI 的这轮合作到底做了什么?

A:围绕 ChatGPT Agent 与 GPT-5,开展联合红队与系统评测,发现代理层面的新型漏洞并在一个工作日内完成修复,同时加强生物安全监控与产品配置防护。

Q:对正在用 ChatGPT Agent 或 GPT-5 的团队有何直接价值?

A:你能继承来自 CAISI、AISI 的实战化对抗样式与修复经验,把“代理劫持、通用越狱、内容外流”等测试纳入回归,降低生产事故风险。

Q:系统卡(System Card)在工程上怎么用?

A:将 GPT-5 与 ChatGPT Agent 的系统卡作为“安全功能说明书”,把高能力域阈值、监控指标与禁用清单转成可执行的策略与测试用例。

Q:仅做上线前渗透测试是否足够?

A:不够。参考本次合作做“全周期评测”:版本灰度—红队复现—规则落地—回归验证,持续覆盖新功能与新工具的攻击面。

推荐工具

更多