2026年9月11日、Anthropicは脅威インテリジェンスレポート「AIの誤用の検出と対策:2026年9月」を発表し、2025年12月から2026年8月の間に特定・阻止した高リスク活動を明らかにしました。このレポートは、サイバー攻撃、監視、作戦への影響、詐欺、生物学的誤用、通常兵器開発、モデルの蒸留という7種類のリスクをカバーしています。セキュリティチームにとって最も注目すべき変化は、悪意のあるユーザーが新たなチャットツールを手に入れたことではなく、AIが偵察、ツールの改造、実行、結果処理といった継続的なプロセスを乗っ取り始めたことです。
攻撃者はもはや技術的な質問に答えるモデルだけではありません
Anthropicは、ほとんどの場合、クロードが直接実行やオーケストレーションに関与し、一部のオペレーターはマルチエージェントフレームワークを使って並行偵察、悪用、データ整理を行い、主に人間がターゲットの特定と結果の確認を担当していると述べています。報告書で言及されているロシア語のスパイ活動は、エージェントが悪意のあるプログラムがセキュリティ製品によって特定されるかどうかを監視し、暴露後は既存の検出を回避するまでそれらを修正・再構築し続けることを可能にしています。関連活動は20以上の組織が関与し、政府、外交、防衛機関を標的にする予定です。
このようなクローズドループは攻防のリズムを変えます。かつては防御側がチェックインルールを導入し、通常は一時的に攻撃コストを上げていましたが、現在ではエージェントは故障を継続的に観察し、ツールを再構築できます。人間のオペレーターを排除するわけではありませんが、繰り返しの試行錯誤、環境理解、クロスターゲット適応を並行機械のタスクに変換するため、攻撃規模と速度は大幅な人員増員なしで同期して上昇する可能性があります。
AIの資格自体もサプライチェーンの標的となっています
報告書では、APIキー、セッショントークン、レビューサンドボックスも新たな攻撃対象として挙げられています。あるケースでは、攻撃者がAIベンダーの自動レビューサンドボックスに悪意ある命令を注入し、その環境で保有された本番APIキーを入手した後、約4日間で約30社のAI企業を攻撃しようとしました。Anthropicは、攻撃者がAnthropicのシステムに侵入したり、プレリリースのClaudeモデルを取得したりしたわけではないと強調しました。この区別は重要です。リスクは顧客統合、プロキシツール、サンドボックス権限チェーンから生じており、必ずしも基盤モデルサービスが直接侵害されることからではありません。
同社の防衛はコンテンツフィルタリングから実行チェーンへとシフトすべきです
プロンプトや最終返信を確認するだけでは、エージェントの行動を把握できなくなりました。企業は制御ポイントを少なくとも3つの位置に前進させるべきです:ツール呼び出しは最小限の権限を使用し、高リスクな行動は手動で確認すること;レビューやブラウジング環境では本番認証情報へのアクセスを禁止し、ネットワークの終了はタスクホワイトリストによって制限されます。APIキーはワークロードごとに隔離され、異常なスループット、地域間通話、長期間の無人行動を監視します。静的な悪意サンプル検出は依然として価値がありますが、行動検出、認証情報のローテーション、監査ログと組み合わせる必要があります。
報告書には守るべき境界線も含まれています
これらの事例はAnthropicが自社のプラットフォーム観察に基づいてまとめたものであり、Claudeの典型的な利用状況を代表せず、業界全体の状況を直接推論することもできません。ベンダー開示は他のプラットフォームがパターンを特定するのに役立ちますが、重要な結論は依然として法執行機関、セキュリティ研究者、影響を受ける組織による相互検証が必要です。企業にとって合理的な判断はプロキシの使用を止めることではなく、プロキシを実行能力を持つソフトウェアエンティティとして扱うことです。まずアクセス・呼び出せるものを制限し、その後モデル自体が安全かどうかを評価します。