ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
Nemotron 拿下双料金牌:IOI 超过人类冠军,IMO 刚过金牌线

Nemotron 拿下双料金牌:IOI 超过人类冠军,IMO 刚过金牌线

AI资讯 • Admin • • 5 次浏览

Nemotron 在 2026 年 10 月 7 日由 NVIDIA 团队在 Hugging Face 博客汇总公布:同一模型家族的两个微调版本,分别在 2026 年国际信息学奥林匹克(IOI)和国际数学奥林匹克(IMO)上达到金牌水平,其中 IOI 成绩还超过了当届人类最高分。

两块金牌,先看成色

信息学这边,竞赛编程版本在与人类选手相同的时间、断网和提交次数约束下现场作答,600 分满分拿到 535.4 分,高于 361.12 分的金牌线,也高于人类第一名的 498.27 分;不过团队明确说明,这是一次非官方、无人监督的基准运行,成绩不进入 IOI 官方排名。数学这边,系统以纯自然语言写证明,不用形式化证明工具、不联网,最终拿到 42 分中的 30 分,超过 29 分的官方金牌线,六道题里四道拿到满分,答卷由 IMO 官方阅卷人评分。两边的含金量口径并不相同,读的时候要分开看。

靠的不是更大的底座

两个项目用的是同一套打法:以 Nemotron 3 为底座,先用领域数据做监督微调,部分再叠加强化学习,最后配上生成、校验、再修正的推理循环。编程版从 2.2 万道竞赛题的推理轨迹中学习,再用名为 GenCorrect 的策略按评测反馈多轮改代码;数学版的训练数据则同时包含写证明、改证明和验算证明,让通用模型、微调模型和强化学习模型在同一系统里互相挑错。团队的结论是,金牌来自微调与测试时计算的配合,而不是单纯堆参数或堆采样次数。

开源部分和没说出口的成本

这次一并放出的包括两个方向的模型权重、训练数据、推理流水线和一份含 200 道新题的 IMO 基准,放在 Hugging Face 与 GitHub 的 NVIDIA-NeMo 组织下。对研究者来说,这意味着成绩第一次有了可复跑的完整路径,而不只是一个分数截图。但也要看到另一面:数学系统的最后一轮筛选是高算力阶段,完整复现对算力和时间的要求并不低。开放权重降低了参与门槛,却没有抹平算力差距——这是这类开源竞赛成绩在庆祝之外,值得同时记住的一点。

推荐工具

更多