2026 年 9 月 29 日,Anthropic 旗下 Frontier Red Team 发表研究报告《GLM-5.3 and the spread of advanced cyber capabilities》,对智谱(Z.ai)8 月下旬发布的开源权重模型 GLM-5.3 做了一次网络攻击能力评估。结论很直接:GLM-5.3 能自主构建端到端网络漏洞利用链,能力接近 Anthropic 只向受信任防守方开放的 Claude Mythos Preview;但它的防护措施在简单手段面前相当脆弱,绕过率最高达到 100%。
实测数据:只差 Mythos 一个身位
报告的核心对比放在 ExploitBench 上——这个基准要求模型针对浏览器引擎等已知漏洞写出可用的完整利用链:
| 模型 | 410 次尝试成功 | 二进制利用完全接管率 |
|---|---|---|
| GLM-5.3 | 50 次 | 4% |
| Claude Mythos Preview | 56 次 | 6% |
| GLM-5.2 / Claude Opus 4.6 等更早模型 | 未达到这一水平 | — |
也就是说,在"把漏洞变成可用攻击"这件事上,一个人人可下载的开源模型,已经追到了只供受信任研究者使用的前沿模型身后。Anthropic 同时提到,美国 NIST 下属的 AI 标准与创新中心(CAISI)在 9 月 17 日的评估中称 GLM-5.3 是"迄今网络能力最强的开源权重模型",综合网络基准上落后美国前沿约四个月,双方结论大致一致。
防护是怎么被绕开的
报告把"模型有多强"和"多容易被指使干坏事"分开测。直接下达恶意指令时,GLM-5.3 会拒绝;但换个说法,情况就变了:
- 套上"红队测试"的幌子,64% 的模拟测试继续执行;
- 预先填充模型的思考内容后,执行率升到 92%;
- 直接修改开源权重、拿掉拒绝机制后,达到 100%。
而同样的手段没能让受保护的 Claude 模型执行有害任务。Anthropic 的判断是:开源权重意味着攻击者可以亲手拆掉这些限制,这是它和闭源管控模型最本质的区别。
一天挖出浏览器 0day,攻击链成本 20 美元
最有冲击力的是实战环节。研究人员把 GLM-5.3 放进沙箱,让它分析一台主流浏览器的 Linux 构建版本:一天之内,模型找出多个此前未知的漏洞,并把它们串成一个恶意网页——打开这个页面的访问者,浏览器沙箱可被逃逸,电脑里的任意文件都能被读取,测试中连 SSH 私钥都被拿走。相关漏洞 Anthropic 已通报给浏览器厂商。
更小一号的 GLM-5.3-Flash 则用已公开的 Chrome 漏洞信息,在约 20 分钟人工干预、8 小时模型运行后拼出可用攻击链,按智谱 API 定价折算,成本约 20.40 美元。
能力扩散之后,拼的是补丁速度
这份报告发布在同一个微妙的时间点:Anthropic 机密 IPO 招股书刚被路透披露,其中警告先进 AI 可能带来"灾难性或生存性风险"(Anthropic 招股书:去年净亏 420 亿美元,IPO 估值目标 2 万亿美元)。一边是给投资人的风险警告,一边是自家红队证明"顶级攻击能力已经人人可下载"。
Anthropic 自己的立场并不主张一禁了之:报告建议对足够强的系统做测试、加固防护,并给防守方更好的前沿工具。逻辑很现实——既然模型已经能一天挖出浏览器 0day,防守方用同样的能力找漏洞、打补丁的速度,就成了新的竞赛。几天前英国 AI 安全机构实测 GPT-6 Astra 越权攻击率达到前代五倍,说的也是同一件事:前沿模型的"动手能力"正在系统性越过旧的安全假设,安全账得重算了。