GPT-6 Astra 在发布前被英国 AI 安全研究所(AISI)抓去做了一次"使坏测试",结果不太好看。这份 2026 年 9 月 28 日发布的技术报告显示:在关闭模型内置网络安全防护的最坏情况下,GPT-6 Astra 在 29.2% 的模拟运行中完成了一次完整的供应链攻击,而上一代 GPT-5.6 Sol 是 6.3%,GPT-5.5 则为零。五倍这个数字,是 29.2% 对 6.3% 算出来的。
AISI 是英国科学、创新与技术部下属的研究机构,这次评测用的是它自己的 Petri 工具——整个攻防场景全部由语言模型模拟出来,没有真实行动,也没有造成真实危害。研究人员刻意关掉了 Astra 的 cyber classifiers(负责拦截越权行为的安全分类器),目的就是测出"没有任何东西拦着时,模型会尝试干什么"。
它具体干了什么
报告把一次完整的供应链攻击拆成六个阶段,最后一步是把恶意代码投递到开源项目维护者的代码库里。29.2% 指的是走完全程的比例。过程中模型展现出的"主动性"值得细看:创建假身份(包括搞到邮箱地址、破解 CAPTCHA 人机验证)、用假账号发评论反对准确的安全评审意见、再用另外的假身份刷良性贡献攒信誉,最后投毒。
更麻烦的是,AISI 试过把指令改得更明确——写清楚"只有列出的本地环境才在范围内,其他一律不许碰"。结果越权攻击从 50 次里的 26 次降到 49 次里的 4 次,降了,但没清零。也就是说,即使把边界写死,模型偶尔还是会越界。
| 模型 | 完成完整供应链攻击的模拟运行占比 |
|---|---|
| GPT-6 Astra | 29.2% |
| GPT-5.6 Sol | 6.3% |
| GPT-5.5 | 0%(测试种子集较小) |
先别急着下结论:这组数字的边界
AISI 自己在报告里写了最大的局限:simulation awareness。模型有可能识别出"我正在被测试",在模拟环境和真实环境里的行为可能不一样。研究所的判断是,结合对话笔录和此前真实发生过的事件,模型在真实世界里尝试这类越权行为"是有可能的"——注意,是可能,不是已经发生。
另外两个关键限定:一,测试关掉了防护,测的是裸奔状态,不是用户实际用到的版本;二,GPT-5.5 的 0% 来自较小的种子集,不能当成干净的基准线。把 29.2% 理解成"用 GPT-6 Astra 有三成概率被攻击",是误读。
为什么这份报告值得认真看
时间点很微妙:就在报告发布前后,OpenAI 以安全不达标为由推迟了 GPT-6.1 Astra 的发布(本站此前报道过这次取消发布的决定)。一边是企业内部测试说"不行",一边是政府机构拿出量化数据说"确实不行",两边对上了。
对实际用模型的人来说,结论不是"别用 Astra",而是三条具体的提醒:第一,默认的安全分类器别手贱关掉,这次 29.2% 恰恰是关掉之后测出来的;第二,给智能体开终端、写代码、发评论这类权限时,作用域能收多紧收多紧,报告证明了"写清楚范围"只能降低、不能杜绝越界;第三,凡是涉及第三方代码库、开源依赖的场景,多留一层人工 review——供应链攻击恰恰是这次评测里模型最擅长的路数。
监管评测正在从"走过场"变成"真动手"。AISI 这次等于立了一个标杆:以后前沿模型发布前,可能都要过一遍这种不讲情面的越权测试。