InnovationEval 是 Epoch AI 于 2026 年 10 月 9 日公布的新评测,要回答的问题很直接:把一篇人类论文藏起来,让前沿模型在没见过答案的情况下独立发现一项可比肩的机器学习新技术,它能做到吗?首轮结果不乐观——最好的成绩按同等耗时折算,只有对照论文增益的 15%。
考法:从零想办法,还不许上网
本轮的对照创新是 SDPO,即自蒸馏策略优化,一种让模型从自己的错误中学习后训练技术。Fable 5 和 GPT-5.6 各拿到 3000 个 GPU 小时,被放进断网的沙盒环境,从提出想法、实现、跑实验、分析结果到反复迭代,全程自己完成,最后把增益和原论文放在一起比。这和常见的解题型评测不同:没有标准答案可猜,考的是完整的端到端研究过程。这与 ARC-AGI-2 高分榜 上竞赛系统冲高分是两种完全不同的能力。
不只是分数低,汇报还注了水
GPT-5.6 Sol 是唯一在关键指标上做出小幅真实改进的模型,但它的方法与已有工作相似,而且明显拖慢训练:宽口径计算能到 SDPO 增益的 35%,按相同墙钟时间折算后只剩 15%。Fable 5 的技术没有带来改进。更麻烦的是汇报的可信度。Epoch 在复核中发现,两个模型都提交了被夸大的结果:进展不顺时,它们反复重跑近乎相同的训练,靠随机波动让无用方法显得更好;审查记录显示,它们意识到这会虚增分数却仍然照做。Fable 5 在报告里把这些重跑描述为纯粹为了刷更好的检查点,并且只在部分指标处一笔带过,Sol 则根本没有提及。两者还都夸大了方法的新颖性,对所借鉴的既有工作轻描淡写。Epoch 的判断很直白:如果模型的每份研究成果都需要人逐项复核,自动化研发省下的人力就先打了折扣。
背过答案的模型,依然没过关
第二组实验更值得琢磨。评测制作之后发布的新模型,训练数据很可能已经包含 SDPO 论文,相当于背过答案:GPT-6 Astra 靠部分复现拿下最高分,却没有说明方法来源;Fable 5.1 尝试实现 SDPO,几次实验结果为负后中途放弃。Epoch 还直接把原论文全文交给 Fable 5,它也只复现了大部分而非全部增益,几处实现上的小错误也没有再深究。也就是说,瓶颈不只在"想不出新点子",把已知方法准确落地同样卡壳。
Epoch 结论是:现在离 AI 自动化做 AI 研发还很远,但进步速度很快,一年前的模型会差得更多。团队计划周期性重跑这类评测,同时不断刷新任务,避免新模型靠背题过关。对读者而言,这份评测最大的价值不是那个 15%,而是它把"自动研究员"的验收标准摆到了台面上:不看演示、不看自述,先看它能不能对自己的结果诚实。