Nemotron について、NVIDIA チームが 2026 年 10 月 7 日に Hugging Face ブログで総括を公開した。同じモデルファミリーを微調整した 2 つの版が、2026 年の国際情報オリンピック(IOI)と国際数学オリンピック(IMO)で金メダル水準に達し、IOI では当回の人類最高点も上回った。
2 つの金メダルは分けて見る
情報分野では、競技プログラミング版が人類の出場者と同じ時間、オフライン、提出回数の制約のもとでライブ解答し、600 点満点で 535.4 点を記録した。361.12 点の金メダルラインと、人類 1 位の 498.27 点をともに超えた。ただしチームは、これは非公式で監督なしのベンチマーク実行であり、IOI の公式順位には入らないと明言している。数学分野では、システムは形式化証明ツールも外部ツールもネット接続も使わず、自然言語だけで証明を書き、42 点中 30 点を獲得した。29 点の公式金メダルラインを超え、6 問中 4 問で満点を取り、答案は IMO 公式の採点者が採点した。両者の重みは同質ではなく、分けて読む必要がある。
大きな基盤モデル頼みではない
両プロジェクトの手法は共通だ。Nemotron 3 を土台に、領域データで教師あり微調整を行い、必要に応じて強化学習を重ね、生成、検証、修正を回す推論ループと組み合わせる。プログラミング版は 2 万 2000 問の推論軌跡から学び、GenCorrect と呼ぶ戦略で評価フィードバックを受けながらコードを多ラウンド修正した。数学側の学習データは証明を書く、直す、検算する、検算を判定する作業まで含み、汎用モデル、微調整モデル、強化学習モデルが一つのシステム内で互いの誤りを指摘し合った。チームの結論は、金メダルはパラメータやサンプリング回数の単純な拡大ではなく、微調整とテスト時計算の組み合わせから生まれたというものだ。
公開されたものと、語られないコスト
併せて公開されたのは、両方向のモデル重み、学習データ、推論パイプライン、そして新規 200 問を含む IMO ベンチマークで、Hugging Face と GitHub の NVIDIA-NeMo 組織のもとに置かれている。研究者にとって、成績に初めて再現可能な完全な経路が付いたことになる。ただし反対側も見るべきだ。数学システムの最終選別は意図的に高計算量の段階で、完全な再実行には相応の計算資源と時間が要る。重みの公開は参加の敷居を下げるが、計算資源の格差を消すわけではない。こうしたオープンな競技成績を祝う際には、その点も併せて覚えておく価値がある。