OpenAI 在 2026 年 10 月 6 日通过官方博客发布了一批由内部未发布前沿模型产出的数学研究成果,规模大得不像一次常规公开:722 份手稿、372 个结果家族,覆盖数百个长期悬而未决的数学问题。成果没有发在期刊里,而是统一放进一个 GitHub 仓库,并附上手稿修订与引用规范,等数学界自己来验。
这批成果到底宣称了什么
OpenAI 在 2026 年 9 月就曾表示,自家模型已经解决了一百余个长期悬而未决的公开难题,覆盖数学的绝大多数分支。这次公开的文稿把当时的说法落成了可查阅的文本:除了证明本身,还包含一部分模型推理过程的摘要、算力消耗估算,以及模型一共尝试求解过多少问题。按 OpenAI 的说法,一项普通成果消耗的算力,大致相当于 ChatGPT Pro 连续思考三小时的水平。
换句话说,这不是模型灵光一闪答对一道题,而是一条被批量运行的流水线:大量难题被逐个喂给同一个未发布模型,产出再被整理成手稿集中放出。产出量本身就是信号——前沿模型在数学上的用法,正在从竞赛刷题变成规模化地啃开放问题。
为什么附带了 Lean 形式化
这批成果里有相当一部分证明被用 Lean 形式化。Lean 是一套能让计算机逐行检查证明是否成立的工具,形式化之后的证明对不对,不靠评审专家的直觉,机器验算就能给出结论。在 AI 生成内容最受质疑的环节恰恰是可信度,用可机检的形式顶住一部分质疑,是这批手稿和普通预印本最不一样的地方。
但也要分清边界:被形式化的只是其中一部分,其余手稿仍要靠人类数学家逐份评估、消化。OpenAI 自己也承认,这批研究带来的完整影响还需要一段时间才能显现。722 份手稿里有多少能经得起同行检验,现在下结论为时过早。
争议不在答案,在发布方式
围绕这批成果的讨论,焦点其实不在数学本身。9 月下旬,由数学家组成的独立咨询小组 AGMAI 发布了首批建议,核心就几条:实验室应尽量通过成熟的学术渠道及时发布数学成果;应披露所用模型的名称、提示词和算力开销;并且明确劝告,不要把发布数学成果当作推广自家模型的营销手段。
对照这几条看本次发布,能看到 OpenAI 在回应其中一部分:成果集中公开、算力口径给了、修订与引用规范也补上了。但最关键的一项仍然缺席——产出这批成果的模型没有公布名称,是一款尚未发布的内部前沿模型。读者能验算证明,却无从复现产生证明的过程。对数学界来说,证明成立与否可以独立检验;对 AI 行业来说,这次发布真正值得盯的是另一件事:当模型开始成批产出可检验的科研成果,实验室的发布规范能不能跟上产出速度。