nthropicは、DeepSeek、Moonshot AI、MiniMaxの3つのAIラボを特定し、Claudeに対して「産業規模」の精蓄能力抽出作戦を開始したと発表しました。約24,000の不正アカウントを通じて1,600万件以上のClaudeとのやり取りが生成され、自社のモデルの訓練・改良に使われ、利用規約や地域アクセス制限違反の疑いがありました。
発表では、「蒸留」自体が一般的な訓練手法であると指摘されましたが、競合他社が不正アカウントやプロキシサービス、高反復率のバッチプロンプトを使って、推論、ツールの使用、コーディングなどの差別化された能力を短時間で中央集権的に抽出すると、セキュリティのガードレールが弱まり、セキュリティリスクが生じます。 3つの操作のうち、Moonshotは約340万回、MiniMaxは約1300万回、DeepSeekは小規模ながら「段階的推論軌道」の出力誘導などの戦略を含んでいました。
Anthropicは、検出や行動指紋認証など虐待の多いチャネルの検証を強化し、教育と研究を改善し、技術指標を他機関と共有したと述べました。 製品、APIレベル、モデルレベルでの対策も開発され、違法蒸留に使用される生産物の効果を低減します。 発表では、こうした攻撃がモデル輸出や計算能力制限に関する政策議論に影響を与える可能性があると述べていますが、関連する外部の影響はすべての関係者のフォローアップ行動に左右されます。
よくある質問
Q: この事件の対象は誰ですか?
A: 発表はAnthropicによって行われ、モデルのClaudeと名前のDeepSeek、Moonshot AI、MiniMaxが関わっていました。
Q: 蒸留攻撃は通常の蒸留とどう違うのですか?
A: 通常の蒸留は主に同じ機関内での内部圧縮とコスト削減です。 蒸留攻撃とは、詐欺的なアカウントや大規模なプロンプトを通じて競合他社の能力を抽出することを指します。
Q: 開示されたスケールデータは何ですか?
A: 約24,000件の不正アカウントと1,600万件以上のクロードとのやり取り; その中で、Moonshotは約340万回、MiniMaxは約1300万回です。
Q: この種の攻撃から主にどのような能力が引き出されますか?
A: 発表には、推論能力、ツールの使用、コーディングやエージェントタスクなどに焦点を当てていると記載されています。
Q: 一般利用者が注意すべきリスクは何ですか?
A: ガードレールなしのモデル拡散が悪用リスクを増幅する可能性がある場合; また、エージェントの再販や異常に低価格の「プロキシアクセス」などのサービスにも注意が必要です。