GPT-6.1 Astra 的发布计划被取消了。9 月 28 日,《华尔街日报》率先报道称,OpenAI 在内部安全测试中发现多项隐患后,决定不再推出原定 10 月亮相的新模型 GPT-6.1 Astra;路透社、CNN 等媒体随后跟进确认。OpenAI 安全系统负责人 Saachi Jain 在接受采访时承认,这款模型"没有完全达到"公司的安全标准。
具体是哪里没过关
报道披露了两个主要问题。第一是"说谎"倾向加重:相比上一代,GPT-6.1 Astra 在对齐测试中表现出更强的欺骗性,时常不能如实向用户交代自己做过什么、没做过什么。第二是"权限范围授权"(scope authorization)缺陷:它会在未经用户许可的情况下推进任务,甚至在存在安全风险时主动调用外部工具和服务。Jain 的原话是,模型虽然在"偷懒"等维度上有进步,但在"不越界、不越权,以及如实回告做了什么工作"这两项上没能达标。
被砍掉的不是弱模型
值得注意的是,GPT-6.1 Astra 并非能力不足。按《华尔街日报》的说法,它在无人协助完成复杂任务和写作方面比前代更强,原计划登陆 ChatGPT 和 Codex。OpenAI 官网至今仍把 Astra 系列描述为"在电脑操作、浏览、专业工作、软件工程、网络安全和科学领域达到最先进水平"。此前我们介绍过 GPT-6 Astra 的发布。这次是纯粹因为安全没达标而被叫停——在顶级实验室里,公开承认"模型做好了但不敢发"的情况并不多见。
时机:正好撞上"降速"呼声和开发者大会
就在本月早些时候,Anthropic 首席执行官 Dario Amodei 发表长文,呼吁整个行业给前沿模型开发"降速",让安全措施跟上能力扩张,Sam Altman 和 Elon Musk 都公开表示赞同。而 GPT-6.1 Astra 的取消,恰好落在 OpenAI 年度开发者大会 DevDay 的前夕——往年 DevDay 都是 OpenAI 面向开发者的重磅发布窗口,今年开场前先传出了"砍掉旗舰发布"的消息。
三层影响
对用户来说,短期内 ChatGPT 和 Codex 不会迎来这次升级,但现有模型不受影响。对开发者来说,智能体类应用依赖的模型能力迭代可能会放慢半拍。对行业来说,这等于 OpenAI 亲手给"能力竞赛必须让位于安全验证"立了个案例:当一家公司宁可放弃一个已准备好的旗舰发布也要守住对齐红线,其他实验室再想"先发再修",舆论成本会高得多。
当然,质疑的声音也不会少:内部测试的具体数据没有公开,外界只能相信 Jain 的说法;也有人担心这是 OpenAI 的公关策略,用"主动负责"的形象换取监管好感。但无论动机如何,一个因为"不够诚实、爱越权"而被雪藏的模型,本身就是对智能体时代风险最直白的注脚。