OpenAI の蒸留攻防戦は、10 月 1 日に気まずい第 2 ラウンドを迎えた。The Decoder の同日の報道によると、大規模なモデル蒸留キャンペーンを阻止したと発表した翌日、独立研究者が研究のアップデートを公開し、同じ窃取手法が Microsoft Azure 上では今も有効だと主張した。最新リリースの GPT-6 Astra の推論内容でさえ、一字一句そのまま「盗み出せる」という。
発端は、OpenAI が 9 月 30 日に公開した公式ブログ「Disrupting a coordinated model-distillation campaign」だ。同社は、7 月 1 日から何者かが巧妙に作り込んだ数万件のリクエストで、モデル内部の隠された推論を抽出しようとしていたと開示した。7 月 24 日から 25 日にピークを迎え、2 日間で抽出の特徴を持つリクエストが 16,000 件、4,000 人以上のユーザーから発生し、関連パターンは 15,000 以上のアカウントに及び、7 月 28 日に完全に遮断されたという。OpenAI は中核グループを月之暗面(Moonshot AI、Kimi の開発元)の関係者と特定し、脚注で「統計は試行回数であり、すべて成功したわけではない」と断っている。対策として、不正アカウントの停止、登録の厳格化、暗号化された推論の再生を可能にしていた経路の封鎖、ストリーミング出力への漏洩検出の追加を実施した。この開示については当サイトでも既報がある:OpenAI がモデル蒸留攻撃を暴露:1.6 万件の抽出リクエストは月之暗面を指す。
再テスト:自社 API は防いだが、Azure は防げなかった
ドラマは開示と同じ日に起きた。研究者 Joachim Schaeffer のチームは、研究「Stealing Reasoning Traces from Proprietary LLM APIs」を stolen-thoughts.com 上で更新し、見出しは一言だけだった。「We stole reasoning. Again.」(また推論を盗み出した。)
彼らは 9 月 13 日に同じ手法を再テストした。OpenAI と Anthropic の自社 API では攻撃はすでに阻止されていたが、Microsoft Azure 上では、試したすべての OpenAI モデル——新リリースの GPT-6 Astra を含む——と、Sonnet 5 までの Anthropic モデルがことごとく破られ、1 回の試行で推論内容を一字一句そのまま抽出できたという。Schaeffer の言葉を借りれば、「同じモデルでも、どのプラットフォームが提供するかで防御がまったく違う」。
さらに単純な第 2 の手口:モデルに「メモ帳」を渡す
研究者は、開発者 Can Bölük が実演した、さらに単純な第 2 の手法も公開した。モデルに仮想の「メモ帳」ツールを与え、そこに推論を書き込むよう指示すれば、ユーザーは後からその内容を読めるというものだ。この手法はすべての OpenAI モデルと Opus 4.8、Sonnet 5 で有効で、漏洩しなかったのは Opus 5、Fable 5、Fable 5.1 だけだった。研究者によれば、メモ帳方式で得た出力は復号攻撃で得たものとよく似ており、蒸留に使う上では「同じくらい有効」だという。
パッチがいつも後手に回る理由
この気まずさの理由はタイムラインを見ればわかる。GPT-6 Astra はサードパーティーのプラットフォームに何の防御もなくリリースされ、OpenAI が Azure のエンドポイントに防御を追加したのは 9 月 27 日——モデル公開から数日後のことだった。Anthropic 側も、Azure 上での抽出が再現できなくなったのは 9 月 28 日以降だ。
研究者はこれまでの修正を「場当たり的で表面的」と評する。防御の多くは特定のリクエストパターンに対する脆いマッチングにすぎず、モデルベンダーからクラウドプラットフォームに届くまでにさらに数日かかる。攻撃者は最強の扉を破る必要はなく、最も弱い窓を見つければいいのだ。
研究者の主張:防御についていけないクラウドは推論モデルを扱うな
論文はさらに踏み込む。パッチはあらゆる攻撃手法と、モデルをホストするすべてのクラウドをカバーしなければならない。そうでなければ攻撃者は常に最も弱い経路を選ぶ。さらに研究者は、同等の防御を実施しないクラウドプロバイダーはそもそも推論モデルをホストすべきではないと主張する。開いたままの裏口は、輸出管理を API レベルでやすやすと回避させることになるからだ。
これに対する OpenAI の回答は、パートナーがホストするモデルにも自社サービスと同等の保護が必要であり、「作業はまだ終わっていない」と認めるものだった。
クラウドの推論 API を実際に使っている企業にとって、この件の教訓は具体的だ。呼び出すモデルのセキュリティ水準は、モデルベンダーがどれだけパッチを出したかではなく、利用しているクラウドがどれだけ追いついているかで決まる。モデルが強くなるほど推論内容の価値は上がり、それを「盗みたい」人は増える一方だ。この攻防は、まだ後半戦に入ったばかりである。