ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
OpenAI 被解雇研究员致信董事会:思维链监控不能再退

OpenAI 被解雇研究员致信董事会:思维链监控不能再退

AI资讯 • Admin • • 11 次浏览

OpenAI 被解雇的三名安全研究员在 2026 年 10 月 7 日把一封信交到了公司董事会和安全委员会手里,信件节选在 10 月 8 日经《华尔街日报》等媒体披露。三人是 Jasmine Wang、Tomek Korbak 与 Mikita Balesni,均出自安全与对齐团队;OpenAI 在 10 月 1 日以违反敏感信息处理政策为由与三人分道扬镳,但没有公开点名,也没有说明涉事的外部机构是谁。这封信同时做了两件事:为三人的行为辩解,并向公司提出一条具体的技术主张。

先把各自的说法摆开

按三人在信中和公开帖文里的陈述,他们与外部方的接触都在职责范围之内:Korbak 说,自己在 OpenAI 调查 Hugging Face 事件期间担任与评测机构 METR 的技术对接人,当时公司正在为这类前所未有的调查摸索流程;Balesni 说,他协调的跨公司可监控性协作事先向汇报线报备过,分享材料前删去了敏感细节;Wang 在 10 月 8 日的帖文中说,她误开一封高管的敏感邮件,源于此前为招聘获得、事后申请撤销却一直没被 IT 处理掉的邮箱权限,她在几分钟内就向当事人报告并再次要求撤销。三人还否认自己是把不可监控架构消息泄露给媒体的人。这些都是当事人一方的说法,信件全文未公开,细节无法独立核对。

信里真正的要求,是保住思维链

信的技术主张很明确:行业至今不知道如何安全地开发和部署一个无法被监控的模型,前沿公司不应继续推进会削弱思维链可监控性的做法;同时应与第三方审计者合作,支持开放透明的安全生态。三人还写道,这次解雇正在让留任员工感到寒意。OpenAI 发言人则表示,解雇与提出安全担忧或公开发声无关,并分享了一位研究负责人在 10 月 8 日发出的内部备忘录节选,称其强烈认同信中的建议。值得注意的是,GPT-6 Astra 的系统卡片此前就承认,其思维链比上一代更难监控,这正是三人担心的方向。

规则不清时,保密和协作必然撞车

这场争执最值得其他实验室看的地方,不在谁对谁错,而在边界的划法:安全研究天然需要与外部评测者交换信息,保密义务又要求什么都不能往外说,两者之间靠什么区分,全凭事后调查认定,就会让每个研究员在做正当协作时先自问一句,这会不会成为下一次调查的材料。三人要求把外部协作的规则写清楚,公司若真认同信中的技术建议,更实际的回应是把可做、不可做、找谁报备写成明文,并公布第三方审计的安排。否则,思维链监控还没退化,先退化的是内部提意见的意愿。

推荐工具

更多