2026年1月9日、Anthropicは「次世代憲法分類器」(Constitutional Classifiers++とも呼ばれる)を立ち上げるための研究論文を発表し、大規模モデルの「一般的な脱獄」攻撃に対する保護効率を向上させました。 関係者によると、新システムは本番環境での追加の計算能力オーバーヘッドを約1%に削減し、無害なリクエストの拒否率を0.05%に低下させ、テストや攻撃・防御のレッドチーム化で安定的に機能する汎用脱獄ソリューションはまだ見つかっていないと述べています。
この仕組みの核心は、防御の複合的なラインです。すなわち、「会話交換」分類器を使って入力と出力を同じ文脈に配置し、その後、2段階のカスケード構造ですべての会話を軽いスクリーニングでカバーし、疑わしいコンテンツのみをより強力な分類器にアップグレードします。 また、旧システムは2種類の手法で引き続き使われることを指摘しました。「リファクタリング攻撃」は有害な情報を一見無害な断片に分解し、それらを組み合わせて組み立てるものであり、もうひとつは「アウトプット難読化」で、比喩や置換語を使って出力を無害に見せる手法です。
よくある質問
Q: AnthropicのConstitutional Classifiers++は主に何を解決していますか?
A: このシステムは大規模モデルのセキュリティ保護を重視しており、「ユニバーサル脱獄」の成功率をガードレールを回避しつつ、コストや誤った拒否を抑制することに重点を置いています。
Q: 前世代と比べて、憲法分類器++の改善点はどこにありますか?
A: 主な変更点は、入出力を同じ「交換」の共同識別として使い、2段階のカスケードとプローブ統合を用いて計算能力のオーバーヘッドと無害なリジェクションを削減することです。
Q: この研究で「ユニバーサル・ジェイルブレイク」とは何を意味しますか?
A: これは、さまざまな質問に対してセキュリティメカニズムを安定的に回避し、モデルに制限されたコンテンツを継続的に出力させることができる一連の攻撃戦略を指します。
Q: 企業や開発者はこの種のセキュリティクラシファイアにアクセスする際に何に注意すべきですか?
A: 誤った拒否がビジネスプロセス、会話ログや機密データのコンプライアンス対応、レッドチーミングの不十分なカバーによる残留リスクに与える影響については、まだ評価が必要です。