ToolNavs AI工具导航
提交工具 登录
返回AI资讯
Anthropic发布Constitutional Classifiers++:以约1%算力开销对抗通用越狱

Anthropic发布Constitutional Classifiers++:以约1%算力开销对抗通用越狱

AI资讯 Admin 105 次浏览

Anthropic于2026年1月9日发布研究文章与论文,推出“Next-generation Constitutional Classifiers”(又称Constitutional Classifiers++),用于提升大模型对“通用越狱”攻击的防护效率。官方称,新系统在生产环境部署中将额外算力开销压到约1%,对无害请求的拒答率降至0.05%,并在其测试与红队攻防中尚未发现可稳定奏效的通用越狱方案。

该方案的核心是组合式防线:用“对话交换”分类器将输入与输出放在同一语境判断,再用两阶段级联结构让轻量筛查覆盖全部对话、仅对可疑内容升级到更强分类器,同时引入基于模型内部激活的线性探针,与外部分类器组成集成判定。研究同时指出旧体系仍会被两类手法利用:把有害信息拆成看似无害片段再拼回的“重构攻击”,以及用隐喻、替换词等方式让输出表面无害的“输出混淆”。

常见问题

Q:Anthropic的Constitutional Classifiers++主要解决什么问题?

A:该系统面向大模型安全防护,重点降低“通用越狱”绕过护栏的成功率,同时控制成本与误拒。

Q:Constitutional Classifiers++相较上一代改进在哪里?

A:主要改在把输入与输出作为同一次“交换”联合判别,并采用两阶段级联与探针集成,减少算力开销与无害拒答。

Q:研究提到的“通用越狱”是什么意思?

A:指一套攻击策略能在多种不同提问上稳定绕过安全机制,持续诱导模型输出受限内容。

Q:企业或开发者接入这类安全分类器要注意什么?

A:仍需评估误拒对业务流程的影响、对话日志与敏感数据的合规处理,以及红队测试覆盖不足导致的残余风险。

推荐工具

更多