Hugging Face berichtet, dass zwei spezialisierte Versionen seines Basismodells Nemotron-3 bei der Internationalen Informatik-Olympiade (IOI) 2026 und der Internationalen Mathematik-Olympiade (IMO) 2026 Ergebnisse auf Goldmedaillenniveau erzielt haben. Das IOI-System Nemotron-3-Ultra-CC erreichte 535,4 von 600 Punkten und lag damit deutlich über der Goldschwelle von 361,12 Punkten sowie über dem besten Ergebnis eines menschlichen Teilnehmers von 498,27 Punkten. Das IMO-System basiert auf Nemotron-3-Ultra und wurde sowohl über überwachtes Feinabstimmen (SFT) als auch mit bestärkendem Lernen (RL) trainiert. Es erzielte 30 von 42 Punkten und lag damit knapp über der offiziellen Goldgrenze von 29 Punkten.
Was haben die Forschenden gemacht?
Beide Projekte gingen von einem großen Nemotron-3-Basismodell aus, sammelten fachspezifische Aufgaben und setzten gängige Methoden für das Nachtraining ein. Für die IOI stellten sie 22.000 Programmieraufgaben zusammen und ergänzten sie um synthetische Schlussfolgerungsschritte. Anschließend nutzten sie SFT und beim kleineren Nano-Modell zusätzlich RL. Außerdem setzten sie eine Inferenzschleife namens GenCorrect ein, die Antworten erstellt, bewertet und überarbeitet. Für die IMO trugen sie einen Bestand von 414.890 gefilterten Beweisbeispielen zusammen, der das Erstellen, Kritisieren und Überprüfen von Beweisen abdeckt. Anschließend stimmten sie einen Checkpoint mit SFT und einen weiteren mit RL fein ab. Das finale IMO-System kombinierte die beiden Checkpoints mit dem allgemeinen Modell und nutzte eine Pipeline aus Erstellen, Überprüfen und Überarbeiten, um Beweise zu erstellen und zu verbessern.
Wo ist die Arbeit verfügbar?
Alle Modelle, Datensätze und der Code sind auf Hugging Face verfügbar. Der Checkpoint Nemotron-3-Ultra-CC kann heruntergeladen werden; das IOI-Paper beschreibt die GenCorrect-Methode. Zum IMO-Projekt gehören die SFT- und RL-Checkpoints, der Benchmark Nemotron-IMO-Bench mit 200 Aufgaben auf Olympiadeniveau sowie ein NeMo-Skills-Repository mit der Inferenzpipeline und den Prompts. Die Autoren hoffen, dass die Community ihr „Rezept in vier Schritten“ übernimmt: mit einem leistungsstarken Basismodell beginnen, Daten zusammenstellen, SFT/RL anwenden und das Modell mit einer feedbackgesteuerten Inferenzschleife kombinieren.
Warum es wichtig ist
Für Entwickler zeigen die Ergebnisse, dass sich ein einziges großes Modell mit einem reproduzierbaren Rezept zur Feinabstimmung in ein Spezialmodell verwandeln lässt, das mit den besten menschlichen Teilnehmern konkurriert. Hobbyentwickler und Forschungsteams können so leistungsfähige Werkzeuge für die Codegenerierung oder das Verfassen von Beweisen entwickeln, ohne ein neues Basismodell von Grund auf trainieren zu müssen.