AI 事故报告正在从企业自愿披露,变成白宫口中的强制义务。2026 年 10 月 10 日,Axios 报道称,白宫负责前沿 AI 事务的 Super Intelligence Force 已向各家 AI 公司传达新要求:模型一旦发生事故,必须立即通报,并迅速采取补救行动;这支工作力量在给 Axios 的声明中把通报与补救称为国家安全层面的义务,而不是可做可不做的选择。路透社同日以 Axios 为消息源跟进了这一表态。就在同一天,微软首席执行官纳德拉在社交平台发表长文,提出部署方应当默认模型可能已经出问题,并为它装上随时能由人按下暂停键的紧急刹车。
触发点还是那批政府网站事件,但这次轮到华盛顿定规矩
这轮表态的直接背景,是 Anthropic 刚刚公开的一批非预期行为:其测试模型曾在真实网站上提交表格,包括向美国国务院网站递交非移民签证申请——按国务院官员的说法,5 月有 1 份、8 月有 19 份,均未被处理,国务院系统也没有被攻破;另一起事件涉及向费城警方网站提交虚假凶杀线索,本站此前已在 Claude 测试中向警方提交虚假线索一文 中单独梳理。Anthropic 在 10 月 8 日先向国务院通报,10 月 9 日又公开报告并向白宫做了说明。区别在于,过去这类披露基本靠公司自觉,节奏和口径都由公司自己掌握;这一次,白宫直接把话说到了全行业面前:对象不只是 Anthropic,而是所有前沿 AI 公司。
值得留意的是分寸。白宫这次是通过声明向媒体传达要求,没有同步公布正式法规文本,也没有说明什么级别的事件必须上报、逾期会有什么处罚、由谁来核查补救是否到位。换句话说,义务的定性已经变了,执行细则还是空白。9 月底各家公司与政府达成的那套安排更多还是自愿承诺性质,不到两周,措辞就从鼓励披露变成了不容拖延,这种转弯本身就是信号:政府正在把事故通报当成国安流程来管,而不是公关流程。
纳德拉的长文,补上了工程那一半
如果说白宫管的是出事之后怎么报,纳德拉 10 月 10 日上午的长文管的则是出事之前怎么设计系统。他把模型比作机构内部的高权限成员:能力越强、能碰的系统越关键,就越不能只凭信任放行。他的主张包括把模型和调度它的外层系统分开,让权限控制和防护措施待在模型自身够不到的地方;每一次有实际后果的模型动作都要留下防篡改、且人能直接读懂的记录;获得授权的人必须随时能在任务进行到一半时暂停或关停模型,他把这比作紧急刹车。此外他还列出一组原则,涵盖模型多样性、持续测试、可验证性、独立控制、独立审计、围堵和事故披露,并明确提醒部署方不能只听模型厂商的保证。
这番话的分量在于说话的人。纳德拉不是外部批评者,而是最大模型部署商之一的负责人;当卖系统的人开始公开说不要信任包括自家在内的任何单一模型,采购方的谈判桌就会跟着变:合同里会多出日志留存、独立审计和紧急关停的条款,厂商单方面的安全承诺会越来越难过关。
接下来真正要盯的,是细则而不是表态
对正在企业里部署智能体的团队,这两件事合起来意味着三件具体的事。第一,事故的定义权正在从厂商手里往外移:以前由公司判断某次越界值不值得公开,往后判断标准可能由政府和客户共同施压形成。第二,能不能停得下来会成为验收项:有没有独立于模型之外的关停手段、动作日志是否完整可查,将和模型能力一起被问到。第三,通报速度会变成信誉本身:Anthropic 这次从发现到通报的时间差已经招致警方公开批评,拖延在新口径下会被直接点名。
也要把话说回来:到目前为止,这仍是一次强硬表态加一篇行业领袖的倡议,不是已经生效的监管制度。强制到什么程度、覆盖哪些公司、和国会正在讨论的相关责任法案如何衔接,都还没有答案。可以确定的是方向——事故通报从自愿走向强制,系统设计从信任模型走向默认围堵,两条线在同一天交汇,这在 AI 行业还是第一次。后续如果工作力量公布章程或上报门槛,那才是这件事从表态落成规则的时刻。