Anthropic于2026年1月9日发布研究文章与论文,推出“Next-generation Constitutional Classifiers”(又称Constitutional Classifiers++),用于提升大模型对“通用越狱”攻击的防护效率。官方称,新系统在生产环境部署中将额外算力开销压到约1%,对无害请求的拒答率降至0.05%,并在其测试与红队攻防中尚未发现可稳定奏效的通用越狱方案。
该方案的核心是组合式防线:用“对话交换”分类器将输入与输出放在同一语境判断,再用两阶段级联结构让轻量筛查覆盖全部对话、仅对可疑内容升级到更强分类器,同时引入基于模型内部激活的线性探针,与外部分类器组成集成判定。研究同时指出旧体系仍会被两类手法利用:把有害信息拆成看似无害片段再拼回的“重构攻击”,以及用隐喻、替换词等方式让输出表面无害的“输出混淆”。
常见问题
Q:Anthropic的Constitutional Classifiers++主要解决什么问题?
A:该系统面向大模型安全防护,重点降低“通用越狱”绕过护栏的成功率,同时控制成本与误拒。
Q:Constitutional Classifiers++相较上一代改进在哪里?
A:主要改在把输入与输出作为同一次“交换”联合判别,并采用两阶段级联与探针集成,减少算力开销与无害拒答。
Q:研究提到的“通用越狱”是什么意思?
A:指一套攻击策略能在多种不同提问上稳定绕过安全机制,持续诱导模型输出受限内容。
Q:企业或开发者接入这类安全分类器要注意什么?
A:仍需评估误拒对业务流程的影响、对话日志与敏感数据的合规处理,以及红队测试覆盖不足导致的残余风险。