ToolNavs 便利なAIツールを発見
ツール投稿 ログイン
戻るAI情報
OpenAIがモデル蒸留攻撃を公開:1.6万回の抽出リクエスト、Moonshot AIに関連

OpenAIがモデル蒸留攻撃を公開:1.6万回の抽出リクエスト、Moonshot AIに関連

AI情報 • Admin • • 8 回閲覧

2026年9月30日、OpenAIは公式ブログに「Disrupting a coordinated model-distillation campaign(組織的なモデル蒸留キャンペーンの阻止)」と題する記事を公開し、自社モデルを狙った「敵対的蒸留(adversarial distillation)」攻撃を明らかにして阻止したと発表した。攻撃者は7月1日から、巧妙に細工した数万件のリクエストでモデルから隠された内部推論の抽出を試みた。OpenAIは、活動の中核をMoonshot AI(Kimiの開発元)関係者によるものと特定し、7月28日に完全に遮断したとしている。

狙われたのは答えではなく「思考プロセス」

攻撃の標的はモデルの回答ではなく、OpenAIが「保護された推論(protected reasoning)」と呼ぶ、課題解決時の内部的な思考記録だった。これを手に入れれば、攻撃者はモデルの能力を再現し、最終回答から意図的に省かれた情報を掘り起こし、自社モデルの訓練に流用できる。

手口は巧妙だった。攻撃者はある会話で暗号化された推論をコピーし、別の会話でモデルにその隠された内容の「復号と書き起こし」を求めた。暗号の解読も、データベースへの侵入も、実ユーザーの会話の閲覧も一切ない。迂回されたのは対話フローそのものだ。暗号化された推論は会話をまたいで持ち運び・再生可能だったのである。

規模を見ると、7月初旬は少量の探りから始まり、7月24〜25日にピークを迎えた。2日間で抽出の特徴を持つリクエストが16,000件、4,000人超のユーザーから発信され、関連するプロンプトパターンは15,000人超のユーザーに及んだ。OpenAIは脚注で、これらの数字は「試行回数」であり、すべてが成功したわけではないと説明している。

なぜOpenAIは国家安全保障の問題として扱うのか

OpenAIの発表は強い調子だ。抽出された推論は別のモデルの訓練に使われ得るが、その新モデルは元のモデルの出力に施された安全ガードレールを継承しない。大規模な蒸留は「能力移転」のコストを下げる一方で、それに見合う安全投資は移転しない。生物・化学などのデュアルユース領域でモデルが強くなるほど、この「むき出しの能力移転」は国家安全保障の問題になるという論理だ。

孤立した事件でもない。この夏、Anthropicが公開したClaudeを狙った同様の蒸留活動も、Moonshot AIを指していた。OpenAIは今回、独立したセキュリティ研究者が責任ある開示で報告した関連脆弱性も確認し、発見内容をFrontier Model Forum経由で業界パートナーや政府の情報共有チャネルに提供した。これは自社の問題処理ではなく、業界共通の脅威としての位置づけを意味する。

OpenAIはどう止めたか、一般ユーザーが注意すべきこと

対策として、OpenAIは不正アカウントを凍結・制限し、登録とインフラの管理を強化、「暗号化推論のリプレイ」という経路を塞ぎ、推論漏えいにつながり得るストリーミング出力を検出する仕組みを追加した。活動がサードパーティのサービスを経由していた場合は、その事業者と連携して遮断した。蒸留攻撃の公表のわずか1日前、本サイトはOpenAI安全事故の前夜:数か月前の社員の警告メールは無視されていたも報じている。OpenAIの安全をめぐる物語はこの2か月、「自主的な開示」と「追い込まれての暴露」の間を揺れ続けている。

一般ユーザーと開発者への教訓は明確だ。「モデルの隠された思考過程を解放する」とうたうサードパーティ製ツールは、今回の攻撃と技術的にほぼ同じ路線を走っている。それらを使うことは、自分のアカウントをこのグレーな供給網の下流に差し出すことに等しい。

より深い層では、この事件はフロンティア企業の堀のひび割れを露呈させた。推論の暗号化自体は破られていない。破られたのは「暗号化された推論は会話間を流れてよい」という設計上の前提だ。今後の防御は出力テキストだけを見ていては足りず、呼び出しチェーン全体を見なければならない。蒸留をめぐる攻防は、これからますます精緻になっていく。

関連記事

おすすめツール

もっと見る