ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
OpenAI 曝光模型蒸馏攻击:1.6 万次提取请求直指月之暗面

OpenAI 曝光模型蒸馏攻击:1.6 万次提取请求直指月之暗面

AI资讯 • Admin • • 10 次浏览

2026 年 9 月 30 日,OpenAI 在官方博客发文《Disrupting a coordinated model-distillation campaign》,披露并处置了一起针对其模型的"对抗性蒸馏"攻击。攻击者从 7 月 1 日起,用数万次精心构造的请求试图从模型中提取被隐藏的内部推理;OpenAI 表示,已将这波活动的核心团伙归因于月之暗面(Kimi 的开发商)相关人士,并在 7 月 28 日将其彻底阻断。

他们在偷什么:不是答案,是"思考过程"

攻击者要的不是回答,而是 OpenAI 所说的"保护推理"——模型解题时的内部推演记录。拿到它,就能复刻模型能力,甚至挖出最终答案里被隐去的信息,再拿去训练自己的模型。

手法颇有"巧劲":攻击者先把某次对话中加密的推理复制出来,再到另一段对话里要求模型"解密并转写"这段隐藏内容。全程没有破解加密、没有入侵数据库,也没有读到任何用户的真实对话——被绕过的是交互流程本身:加密的推理在对话之间是可携带、可重放的。

活动 7 月初低量试探,7 月 24 日至 25 日达到高峰:两天内出现 16,000 次带有提取特征的请求,来自 4,000 多个用户;相关 prompt 模式覆盖超过 15,000 个用户。OpenAI 在脚注里说明,统计的是"尝试次数",不代表全部得手。

为什么 OpenAI 把它上升到国家安全层面

OpenAI 在公告里把话说得很重:被提取的推理可被用来训练另一个模型,而新模型不会继承原模型输出端的安全护栏。大规模蒸馏等于把"能力转移"的成本打下来,却不转移相应的安全投入——当模型在生物、化学等两用领域越来越强时,这种"裸能力转移"就成了国家安全议题。

这也不是孤立事件。今年夏天 Anthropic 披露的针对 Claude 的类似蒸馏活动,矛头同样指向月之暗面。OpenAI 还把独立研究人员经负责任披露提交的相关漏洞一并确认,并把发现同步给 Frontier Model Forum 的行业伙伴和政府渠道——等于把它定性为全行业的共同威胁,而不是 OpenAI 一家的家务事。

OpenAI 怎么堵的,普通用户又该注意什么

处置上,OpenAI 封禁并限制了欺诈账号,加固了注册与基础设施管控,堵住了"加密推理重放"通道,还给流式输出加了可能泄露推理的检测;相关活动经过第三方服务时,也协同服务商一起处置。就在披露蒸馏攻击的前一天,本站还报道了 OpenAI 安全事故前夜:员工提前数月的预警邮件被无视 的消息——OpenAI 的安全叙事,这两个月一直在"主动披露"和"被动曝光"之间摇摆。

给普通用户和开发者的提醒更直接:市面上那些号称"解锁模型隐藏思维链"的第三方工具,技术路线和这波攻击高度重合——用它们,等于把自己的账号送进了灰色产业链的下游。

更深一层,这件事暴露了前沿实验室护城河的一道裂缝:推理加密本身没被攻破,攻破的是"加密推理可以在对话之间流转"这个设计假设。未来的防护不能只盯着输出文本,得看整个调用链。蒸馏攻防,接下来只会更精细。

推荐工具

更多