ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Informationen
Nemotron holt zweimal Goldniveau: Bei der IOI vor dem besten Menschen, bei der IMO über der Linie

Nemotron holt zweimal Goldniveau: Bei der IOI vor dem besten Menschen, bei der IMO über der Linie

KI-Informationen • Admin • • 5 Aufrufe

Nemotron wurde am 7. Oktober 2026 vom NVIDIA-Team in einem Blogbeitrag auf Hugging Face zusammengefasst: Zwei feinabgestimmte Versionen derselben Modellfamilie erreichten Goldmedaillen-Niveau bei der Internationalen Informatikolympiade (IOI) und der Internationalen Mathematikolympiade (IMO) 2026, wobei der IOI-Wert auch den besten menschlichen Teilnehmer übertraf.

Zwei Goldmedaillen, getrennt zu bewerten

Im Informatikteil antwortete die Wettbewerbsprogrammier-Version live unter denselben Zeit-, Offline- und Einreichungsbedingungen wie menschliche Teilnehmende und erzielte 535,4 von 600 Punkten, über der Goldschwelle von 361,12 und über dem menschlichen Spitzenwert von 498,27. Das Team stellt jedoch klar, dass es sich um einen inoffiziellen, unbeaufsichtigten Benchmark-Lauf handelt, der nicht in die offizielle IOI-Wertung eingeht. Im Mathematikteil schrieb das System Beweise ausschließlich in natürlicher Sprache, ohne formale Beweiser, externe Werkzeuge oder Internetzugang, und erreichte 30 von 42 Punkten bei einer offiziellen Goldschwelle von 29, mit voller Punktzahl bei vier von sechs Aufgaben; bewertet wurde von offiziellen IMO-Korrektoren. Beide Ergebnisse haben unterschiedliches Gewicht und sollten getrennt gelesen werden.

Kein größeres Basismodell

Beide Projekte folgten demselben Rezept: Nemotron 3 als Basis, überwachtes Feintuning auf Domänendaten, wo sinnvoll verstärktes Lernen, dazu eine Inferenzschleife, die Kandidaten erzeugt, prüft und verbessert. Die Programmierversion lernte aus Argumentationsspuren zu 22.000 kuratierten Problemen und nutzte eine Strategie namens GenCorrect, um Code über mehrere Feedbackrunden zu überarbeiten. Die mathematischen Trainingsdaten umfassten das Schreiben, Verfeinern und Prüfen von Beweisen sowie das Beurteilen von Prüfungen selbst, sodass Allgemeinmodell, SFT- und RL-Spezialisten sich in einem System gegenseitig kritisieren konnten. Das Fazit des Teams: Die Medaillen entstanden aus der Verbindung von Feintuning und Rechenaufwand zur Testzeit, nicht aus schlicht mehr Parametern oder mehr Stichproben.

Was offen ist, und die unerwähnten Kosten

Veröffentlicht wurden Modell-Checkpoints beider Richtungen, Trainingsdatensätze, Inferenz-Pipelines und ein neuer Benchmark mit 200 Olympiade-Aufgaben, gehostet auf Hugging Face und unter NVIDIAs NeMo-Organisation auf GitHub. Für Forschende kommen die Ergebnisse damit erstmals mit einem reproduzierbaren Weg statt nur einem Screenshot. Die andere Seite verdient gleiche Aufmerksamkeit: Die finale Auswahlstufe des Mathematiksystems ist bewusst rechenintensiv, und eine vollständige Wiederholung verlangt erhebliche Rechenleistung und Zeit. Offene Gewichte senken die Teilnahmehürde, beseitigen aber nicht die Rechenlücke. Das sollte man bei der Feier solcher offenen Wettbewerbsergebnisse mitbedenken.

Empfohlene Tools

Mehr