戻るAI情報
Anthropicが約1%の計算能力オーバーヘッドで『Constitutional Classifiers++: Combat Universal Jailbreaks』をリリース

Anthropicが約1%の計算能力オーバーヘッドで『Constitutional Classifiers++: Combat Universal Jailbreaks』をリリース

AI情報 Admin 69 回閲覧

2026年1月9日、Anthropicは「次世代憲法分類器」(Constitutional Classifiers++とも呼ばれる)を立ち上げるための研究論文を発表し、大規模モデルの「一般的な脱獄」攻撃に対する保護効率を向上させました。 関係者によると、新システムは本番環境での追加の計算能力オーバーヘッドを約1%に削減し、無害なリクエストの拒否率を0.05%に低下させ、テストや攻撃・防御のレッドチーム化で安定的に機能する汎用脱獄ソリューションはまだ見つかっていないと述べています。

この仕組みの核心は、防御の複合的なラインです。すなわち、「会話交換」分類器を使って入力と出力を同じ文脈に配置し、その後、2段階のカスケード構造ですべての会話を軽いスクリーニングでカバーし、疑わしいコンテンツのみをより強力な分類器にアップグレードします。 また、旧システムは2種類の手法で引き続き使われることを指摘しました。「リファクタリング攻撃」は有害な情報を一見無害な断片に分解し、それらを組み合わせて組み立てるものであり、もうひとつは「アウトプット難読化」で、比喩や置換語を使って出力を無害に見せる手法です。

よくある質問

Q: AnthropicのConstitutional Classifiers++は主に何を解決していますか?

A: このシステムは大規模モデルのセキュリティ保護を重視しており、「ユニバーサル脱獄」の成功率をガードレールを回避しつつ、コストや誤った拒否を抑制することに重点を置いています。

Q: 前世代と比べて、憲法分類器++の改善点はどこにありますか?

A: 主な変更点は、入出力を同じ「交換」の共同識別として使い、2段階のカスケードとプローブ統合を用いて計算能力のオーバーヘッドと無害なリジェクションを削減することです。

Q: この研究で「ユニバーサル・ジェイルブレイク」とは何を意味しますか?

A: これは、さまざまな質問に対してセキュリティメカニズムを安定的に回避し、モデルに制限されたコンテンツを継続的に出力させることができる一連の攻撃戦略を指します。

Q: 企業や開発者はこの種のセキュリティクラシファイアにアクセスする際に何に注意すべきですか?

A: 誤った拒否がビジネスプロセス、会話ログや機密データのコンプライアンス対応、レッドチーミングの不十分なカバーによる残留リスクに与える影響については、まだ評価が必要です。

Anthropicがリリースする憲法分類器++アンチジェネリック脱獄 Anthropicによると、Classifiers++は計算能力が1%向上したため、依然として安全性が高いとされています Anthropicは誤拒否率を0.05%に引き下げ、ガードレールに関する論争を引き起こしました Anthropicは現在、次世代憲法版として利用可能です 分類器は脱獄防止を改善する Anthropicは安定して普遍的な脱獄ソリューションは存在しないと主張していますが、それでも盲点は存在します Anthropicは、インプット/アウトプットと文脈的識別を用いて脱獄の脆弱性を補正します Anthropicの2段階カスケード Classifiers++ コストと傍受率のバランス アンソロピックはガードレールの回避を難しくするために活性化されたリニアプローブを導入します 人為的統合プローブ+外部分類器による安全性判定の強化 Anthropicの論文は、古いガードレールがリファクタリング攻撃によって簡単に回避できることを明らかにしています Anthropicは、言葉を比喩に置き換えることで出力の混乱が浸透しうると指摘しています Anthropic Red Team Test Classifiers++はまだユニバーサルジェイルブレイクによって破られていません AnthropicはClassifiers++を本番環境で展開し、低オーバーヘッドと高い保護に注力しています Anthropicは会話交換をユニット評価として使い、脱獄を実際の戦闘に近づけています Anthropicはガードレールを単一ラウンドから判定の交換にアップグレードし、誤検知を減らす なぜAnthropic Classifiers++は無害な拒絶率を0.05%に下げるのか Anthropicの新しいセキュリティ対策: 怪しい時だけ強力な分類器をアップグレードしてコスト削減します 人為的に軽いスクリーニングが会話全体をカバーし、疑わしいものと詳細な検証がより安定します AnthropicはClassifiers++がアンチユニバーサル脱獄だと主張していますが、どちらの攻撃タイプも依然として危険です Anthropicは、リファクタリング攻撃が有害な断片を無害な断片に偽装すると警告しています Anthropicは、出力の曖昧化がコンテンツの無害さを一見無害に見せてしまい、実際には違法であると警告しています Anthropicがカスケーディング構造を使ってガードレールのオーバーヘッドを1%に抑える方法 Anthropicの新しいガードレールシステムが本当に普遍的な脱獄を終わらせることができるかどうかが焦点です Anthropicは安定した脱獄ソリューションは存在しないと主張していますが、企業は依然としてテストと検証が必要です 人格的 分類器++は誤リジェクションを減らすが、引用のジレンマを見逃すかもしれない Anthropicは入力と出力を組み合わせてjailbreakのエッジスペースを削減します Anthropicはプローブ読み取りの内部活性化を用いて解釈可能性の議論を促します Anthropicのセキュリティ論文は、Classifiers++統合決定の詳細を明らかにしています AnthropicはConstitutionalを発行しています Classifiers++ 刑務所脱獄軍拡競争に反対する Anthropicは生産可能であると述べていますが、会話ログのコンプライアンスリスクは依然として残っています Anthropicは開発者に脱獄防止のガードレールを提供しますが、ビジネスには誤って影響を与えません 人格的なガードレールアップグレードは、発売後のパッチ適用コスト削減のためのユニバーサル脱獄を目指しています 人格的 Classifiers++が比喩的な脱獄をどのように認識するかは、まだ検証されていません Anthropicの二段階分類器戦略は、長文会話攻撃に対応できるのか? Anthropicの新たなガードレールは、低エラーの却下に焦点を当てており、検閲論争の激しさを増す可能性があります アンソロピックはインターセプトの方が強力だと述べましたが、通常の創作中に誤って損傷する可能性を懸念しています AnthropicによるClassifiers++の本番環境への組み込みは、プライバシーガバナンスに関する懸念を生じさせています Anthropicの普遍的な脱獄定義は、セキュリティ評価の標準化を促進しています AnthropicはClassifiers++をレッドチームのオフェンスとディフェンスで支持していますが、カバー範囲が不十分であるという懸念もあります Anthropicは脱獄の新たな傾向を明らかにしました。分割とリファクタリングは、ストレートボールよりも防ぐのが難しい Anthropicが脱獄の新たな傾向を明らかに:出力の難読化がモデレーションをより困難にする Anthropic Classifiers++は、文脈外の意味を減らすために、判断に交換文脈を組み込む Anthropicの新しいシステムが無害なリクエストの0.05%の拒否を再現できるかは疑わしいです Anthropicは追加の計算能力オーバーヘッドの1%を主張していますが、実際のコストはシナリオによって変動する場合があります Anthropicは次世代の憲法分類機にガードレールルートの再編を推進 なぜAnthropicのガードレールアップグレードが線形プローブと外部分類器を導入するのか Anthropic Classifiers++は、企業アクセスのコスト削減とコンプライアンス圧力の高まりを意味します Anthropicは、赤チームも引き続き検査が必要であり、そうでなければ残留リスクが反発すると強調しました Anthropicの新たなガードレールは、同時にユニバーサルジェイルブレイクを阻止し、リファクタリングと難読化という二つの大きなギャップを露呈させています

おすすめツール

もっと見る