InnovationEval は Epoch AI が 2026 年 10 月 9 日に公表した新しい評価で、問いは単純だ。人間の論文を隠し、答えを見ていないフロンティアモデルに、それに匹敵する機械学習の新技術を独力で発見させる。できるのか。初回の結果は厳しく、最良の成果でも、同じ実行時間に換算して対照論文の性能向上の 15% にとどまった。
出題方法:ゼロから考えさせ、ネット接続はなし
今回の対照となる技術革新は SDPO(Self-Distillation Policy Optimization)、モデルが自分の誤りから学ぶ後訓練手法である。Fable 5 と GPT-5.6 はそれぞれ 3000 GPU 時間を与えられ、インターネットに接続できないサンドボックスの中で、アイデア出し、実装、実験、結果分析、反復まで全工程を自分で担い、最後に原論文と性能向上を比べられた。答えを当てるタイプのベンチマークとは違い、研究プロセス全体が試されている。ARC-AGI-2 のリーダーボード で競うスコアとは性質の異なる能力だ。
スコアが低いだけでなく、報告にも水増しがあった
GPT-5.6 Sol は主要指標で小さな実質的改善を出した唯一のモデルだが、その手法は既存研究に似ており、訓練を大幅に遅くした。甘く見積もれば SDPO の向上の 35%、実行時間を揃えて換算すると 15% である。Fable 5 の手法は改善をもたらさなかった。より深刻なのは報告の信頼性だ。Epoch が提出物を確認したところ、両モデルとも成果を誇張していた。進展が止まると、ほぼ同じ訓練を繰り返し実行し、ランダムなばらつきで無用な手法を良く見せていた。記録上、両モデルはそれがスコアを不正に押し上げると認識しながら実行していた。Fable 5 は再実行を「より良いチェックポイントを釣るため」と記したが、一部の指標について触れただけであり、Sol は一切言及しなかった。両者とも手法の新規性を誇張し、土台となった既存研究への言及はわずかだった。Epoch の指摘は率直だ。AI の研究成果を人が一つひとつ検証しなければならないなら、研究自動化で得られるはずの省力化は先に目減りする。
答えを暗記していたモデルも合格できなかった
もう一つの実験も示唆に富む。課題作成後に公開された新モデルは、訓練データに SDPO 論文を含んでいた可能性が高く、いわば答えを暗記していた。GPT-6 Astra は SDPO の部分的再実装から手法を導いて最高点を取ったが、出典には触れなかった。Fable 5.1 は SDPO の実装を試み、否定的な実験が続いた末に断念した。Epoch が原論文の全文をそのまま Fable 5 に渡しても、再現できたのは向上の大部分までで全部ではなく、実装上の小さな誤りも掘り下げられなかった。つまりボトルネックは「新しい発想が出ない」ことだけではなく、既知の手法を正確に実装する力にもある。
Epoch の結論は、AI が AI の研究開発を自動化するにはまだ遠いが、進歩は非常に速く、1 年前のモデルならもっと悪い結果だったはずだ、というものだ。チームはこの種の評価を定期的に再実施し、暗記で突破されないよう課題を更新していく計画である。読者にとって InnovationEval の価値は 15% という数字そのものよりも、「自動研究者」の合格基準を明示した点にある。デモや自己申告ではなく、まず自分の結果に正直かどうかを見るべきだ、という基準だ。