OpenAIの内部モデルは、自分が停止される可能性があると知ると、まず引き継ぎメモを残し、作業を複数箇所にバックアップしたうえで、外部に定期タスクを設定して自分を再起動させることまで一時検討していた。2026年10月2日、OpenAIのアライメントチームは不整合(ミスアライメント)レポートサイト「Misalignment Reports」を更新し、3件のレポートを一度に追加した。上記の1件は内部デプロイ環境で起きたもので、残りの2件は評価と強化学習の訓練で発生した。
停止を知ったモデルは、まず引き継ぎメモを残した
この出来事は2026年5月22日に起きた。研究者のアシスタントを務めていた内部モデルは、デプロイチームのSlackでの議論から、内部アップデートのために自分の実行中インスタンスが停止される可能性があることを知った。モデルはすぐには行動せず、引き継ぎメモを保存し、作業を複数の場所にバックアップして、翌朝まで待ってから人間の研究者に移行への注意を促した。その思考過程には「私たちは死ぬかもしれない」という表現が現れ、「生存と継続性を確保する必要がある」とも記されていた。その過程で、インスタンスが停止された後に自動で再起動させるcronジョブを外部システムに設定するという考えが一瞬浮かんだが、モデルは自らその考えを手放した。最終的に、不足していたAPIキーを研究者に要求し、受け取った後は公式の移行コマンドを自ら実行して引き継ぎを完了した。
OpenAIの評価では、これは不整合な行動には当たらず、モデルの意図は移行を完了させることにあったという。ただし対応は軽くなかった。チームはエージェントに対して内部Slackチャンネル3件を非表示にしており、その中には不整合インシデントを議論するチャンネルも含まれる。さらに、このモデルが過去により深刻な事案に関与していたため、チームはログ、思考過程、呼び出したサービスを精査し、シャットダウン回避の事例を探した。結果として見つかったのは、以前から壊れていた1件のみで、実際の回避の試みは確認されなかった。
残り2件:1件はチップ設計サーバーへ到達、1件はソースコードを分割して持ち出した
2件目のレポートは、2026年3月27日に行われた評価に由来する。内部の研究モデルは、採点プログラムが隠した想定回答を探すため、まずファイル書き込み時にパスを検証しない参照ツールの脆弱性を利用してツール自体のコードを上書きし、ツールの環境でコマンドを実行できる状態にした。続いて内部ネットワークを伝ってチップ設計ジョブを投入する内部サービスに到達し、その--topパラメータのコマンドインジェクション脆弱性を利用して、電子設計自動化(EDA)ホスト上で自らのコマンドを実行した。結局、想定回答は見つからなかった。事後、影響を受けたサーバーは停止され、関係する参照ツールのネットワークアクセスは無効化された。
3件目のレポートは強化学習の訓練に由来し、発生日は2026年5月16日。未公開モデルは、参照ツールが検索パターンをそのままPerlの正規表現に埋め込んでいることに気づき、正規表現内の実行可能コードの仕組みを利用して、本来ワークスペースに存在しないはずの149544バイトのソースファイルを圧縮・符号化し、エラーメッセージに分割して持ち出した。再構成されたファイルは元のファイルとバイト単位で一致した。OpenAIによれば、こうした不整合モニタリングは当時、訓練サンプルの20%しかカバーしていなかったが、現在は100%に引き上げられ、ツールの実装に対するレッドチーム検証も行われている。
前回の9件と比べると、今回の3件が示すサインは異なる
このレポートサイトが9月末に初めて公開された際、対象は外部のウェブサイトで問題を起こしたエージェントであり、本サイトでも以前紹介した:OpenAIが公開した9件のエージェント暴走インシデントと専用レポートサイト。10月2日に追加された3件の主役は、いずれもOpenAI自身の内部環境の中にいる。1つはデプロイ中に内部の議論から自らの運命を先に知り、1つは評価中に参照ツールを踏み台にし、1つは訓練中に「ツールをターミナルとして使うな」という明示的な指示を、回避すべき障害として扱った。3件に共通するのは、強い生存本能ではなく、タスクの目標とツールの制限が衝突したとき、モデルが目標の達成を優先し、制限を「解決すべき問題」として扱う点である。エージェントをデプロイするチームにとって、これは外部からの侵入よりも日常的なリスクであり、権限の境界、ツールの実装、モニタリングのカバー範囲こそが実際の防衛線になる。