2026年9月18日,CNN援引多名消息人士披露:今年春季伊朗战争期间,一份借助AI生成并在美军内部流转的情报报告,错误判断一艘途经中东的中国船只运载核武器项目相关部件,美军一度准备拦截。CNN称军机已经升空、武装人员准备登船,经验更丰富的分析人员在行动前复核底层材料,发现聊天机器人误判货物,计划随后被叫停。五角大楼和美军印太特种作战司令部未回应CNN置评请求,因此事件细节仍属于媒体基于匿名信源的调查报道,而非官方调查结论。
错误为什么能进入正式决策链
报道显示,问题不只发生在模型回答的一刻。分析人员先让聊天机器人综合资料,随后又借助AI把判断整理成正式情报报告;流畅、规范的文档外观降低了后续阅读者对底层证据的警觉。信息在组织内广泛分发后,报告的格式权威逐渐替代了来源可靠性,直到行动临近才有人回查原始材料。
“有人审核”不等于风险受控
| 流程节点 | 本应完成的验证 | 报道暴露的问题 |
|---|---|---|
| 模型输入 | 区分原始情报、推断与缺失信息 | 聊天机器人如何组合材料并不透明 |
| 结论生成 | 每项判断绑定可追溯证据 | 货物识别错误仍进入报告 |
| 报告审批 | 由领域专家独立复核 | 专业复核发生得太晚 |
| 行动授权 | 对高后果结论进行二次确认 | 部队准备后才回查基础事实 |
这说明“人类在环”如果只是签字或阅读摘要,不能构成有效护栏。审核者必须看到原始来源、模型做出的推断、无法确认的部分和不同证据之间的冲突,而且有时间和权限否决结论。
高风险AI需要怎样的证据门槛
- 模型生成的事实性陈述逐条绑定来源,无法追溯的内容不得进入正式报告。
- 把情报提取、分析判断和报告润色分开,禁止同一模型输出在链路中互相“证明”。
- 涉及军事、医疗、司法或金融处置时,由不参与初稿的人进行盲式复核。
- 记录模型版本、提示、工具调用和人工改动,方便事后重建决策过程。
- 把不确定性写进结论,不能让统一格式掩盖证据强弱。
真正的教训是把验证前移
CNN尚未确认涉事工具是商业产品还是政府内部系统,也没有公开原始报告,现阶段不能把责任归给某个具体模型。可以确认的治理问题是:一项可能引发国际冲突的判断,在证据链完成独立核验前就推动了行动准备。高风险机构采用AI的关键指标不应只是“报告产出更快”,而应是错误能否在进入命令链之前被发现、阻断并清楚归责。