ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
Anthropic威胁报告:AI攻击开始进入多智能体闭环

Anthropic威胁报告:AI攻击开始进入多智能体闭环

AI资讯 Admin 3 次浏览

2026 年 9 月 11 日,Anthropic 发布《Detecting and countering misuse of AI: September 2026》威胁情报报告,披露其在 2025 年 12 月至 2026 年 8 月间识别并阻断的高风险活动。报告覆盖网络攻击、监控、影响行动、诈骗、生物滥用、常规武器研发与模型蒸馏七类风险。最值得安全团队关注的变化,不是恶意用户又多了一种聊天工具,而是 AI 已开始接管侦察、工具修改、执行和结果整理之间的连续流程。

攻击者不再只让模型回答技术问题

Anthropic 表示,多数案例中的 Claude 已参与直接执行或编排,部分操作者使用多智能体框架并行完成侦察、漏洞利用和数据整理,人类主要负责确定目标与审核结果。报告举出的俄语间谍活动会让代理监测恶意程序是否被安全产品识别,一旦暴露便继续修改和重建,直到逃过现有检测。相关活动规划涉及 20 多个组织,目标包括政府、外交与国防机构。

这类闭环改变了攻防节奏。过去防守方发布一条检测规则,通常能暂时抬高攻击成本;现在代理可以持续观察失败原因并重做工具。它没有消除人类操作者,却把重复试错、环境理解和跨目标适配变成可并行的机器任务,因此攻击规模和速度可能在人员没有明显增加时同步上升。

AI凭据本身也成了供应链目标

报告还把 API Key、会话令牌和评测沙箱列为新的攻击面。一个案例中,攻击者通过向某 AI 厂商的自动评测沙箱注入恶意指令,取得该环境持有的生产 API Key,随后在约四天内尝试攻击约 30 家 AI 公司。Anthropic 强调,对方没有攻破 Anthropic 自身系统,也未获得预发布 Claude 模型。这一区分很重要:风险来自客户集成、代理工具和沙箱权限链,而不一定是基础模型服务被直接入侵。

企业防线要从内容过滤移到执行链

只检查提示词或最终回复,已经看不见代理在中间做了什么。企业至少要把控制点前移到三个位置:工具调用使用最小权限并对高风险动作人工确认;评测与浏览环境禁止接触生产凭据,网络出口按任务白名单限制;API Key 按工作负载隔离,监控异常吞吐、跨区域调用和长时间无人值守行为。静态恶意样本检测仍有价值,但必须与行为检测、凭据轮换和审计日志组合。

报告也有需要保留的边界

这些案例由 Anthropic 基于自家平台观测整理,属于其认为最显著、最新颖的威胁,并不代表 Claude 的典型使用方式,也不能直接推断整个行业的发生率。厂商披露能帮助其他平台识别模式,但关键结论仍需要执法机构、安全研究者和受影响组织交叉验证。对企业而言,合理判断不是停止使用代理,而是把代理视为拥有执行能力的软件主体:先限制它能接触什么、能调用什么,再评估模型本身是否安全。

推荐工具

更多