Oossa

Nemotron-modellen halen goudniveau bij IOI en IMO

Fijngetrainde varianten van Nemotron-3 scoorden boven de goudgrens bij de Internationale Informatica-olympiade en de Internationale Wiskunde-olympiade van 2026.

Door Gepubliceerd door Oossa: 1 min lezen

Nikita Kachanovsky · Unsplash

Hugging Face meldt dat twee gespecialiseerde versies van het basismodel Nemotron-3 goudmedaillescores behaalden bij de Internationale Informatica-olympiade (IOI) van 2026 en de Internationale Wiskunde-olympiade (IMO) van 2026. Het IOI-systeem, Nemotron-3-Ultra-CC, behaalde 535,4 van de 600 punten: ruim boven de goudgrens van 361,12 en hoger dan de hoogste menselijke score van 498,27. Het IMO-systeem, gebaseerd op Nemotron-3-Ultra en getraind met zowel supervised fine-tuning (SFT) als reinforcement learning (RL), behaalde 30 van de 42 punten, net boven de officiële goudgrens van 29.

Wat deden de onderzoekers?

Beide projecten begonnen met een groot basismodel van Nemotron-3. De onderzoekers verzamelden domeinspecifieke opgaven en pasten gangbare methoden voor verdere training toe. Voor de IOI verzamelden ze 22.000 programmeeropgaven en voegden ze synthetische redeneerstappen toe. Daarna pasten ze SFT toe en, voor het kleinere Nano-model, ook RL. Daarnaast gebruikten ze een inferentielus met de naam GenCorrect, die antwoorden genereert, beoordeelt en verfijnt. Voor de IMO stelden ze een corpus samen van 414.890 gefilterde bewijsvoorbeelden, gericht op het opstellen, bekritiseren en controleren van bewijzen. Vervolgens trainden ze één checkpoint met SFT en een ander met RL. Het uiteindelijke IMO-systeem combineerde beide checkpoints met het algemene model en gebruikte een genereer-controleer-verfijnproces om bewijzen op te stellen en te verbeteren.

Waar is het werk te vinden?

Alle modellen, datasets en code zijn beschikbaar op Hugging Face. Het checkpoint Nemotron-3-Ultra-CC kan worden gedownload en in de IOI-paper wordt de GenCorrect-methode beschreven. Het IMO-project bevat de SFT- en RL-checkpoints, de benchmark Nemotron-IMO-Bench met 200 olympiade-opgaven en een NeMo-Skills-repository met de inferentiepijplijn en prompts. De auteurs hopen dat de community hun ‘recept in vier stappen’ overneemt: begin met een sterk basismodel, stel zorgvuldig data samen, pas SFT/RL toe en combineer dat met een feedbackgestuurde inferentielus.

Waarom het ertoe doet

Voor ontwikkelaars laten de resultaten zien dat je van één groot model een specialist kunt maken die zich kan meten met de beste menselijke deelnemers, met behulp van een reproduceerbare methode voor fijnafstemming. Zo kunnen hobbyisten en onderzoeksteams krachtige tools voor codegeneratie of het schrijven van bewijzen bouwen zonder vanaf nul een nieuw basismodel te trainen.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.