Hugging Face riferisce che due versioni specializzate del suo modello di base Nemotron‑3 hanno ottenuto punteggi da medaglia d’oro alle Olimpiadi Internazionali di Informatica (IOI) e di Matematica (IMO) del 2026. Il sistema per le IOI, chiamato Nemotron‑3‑Ultra‑CC, ha totalizzato 535.4 punti su 600, ben oltre la soglia per l’oro di 361.12 e sopra il miglior punteggio umano, pari a 498.27. Il sistema per le IMO, basato su Nemotron‑3‑Ultra e addestrato con fine-tuning supervisionato (SFT) e apprendimento per rinforzo (RL), ha totalizzato 30 punti su 42, appena sopra la soglia ufficiale per l’oro, fissata a 29.
Che cosa hanno fatto i ricercatori?
Entrambi i progetti sono partiti da un modello di base Nemotron‑3 di grandi dimensioni, hanno raccolto problemi specifici per ciascun ambito e applicato tecniche standard di post-addestramento. Per le IOI hanno selezionato 22,000 sfide di programmazione e aggiunto tracce sintetiche di ragionamento, quindi hanno applicato SFT e, per il modello Nano più piccolo, RL. Hanno inoltre utilizzato un ciclo di inferenza chiamato GenCorrect, che genera, valuta e perfeziona le risposte. Per le IMO hanno raccolto un corpus di 414,890 esempi di dimostrazioni filtrati, riguardanti la generazione, la critica e la verifica; hanno quindi messo a punto un checkpoint con SFT e un altro con RL. Il sistema finale per le IMO ha combinato i due checkpoint con il modello generale e ha utilizzato una procedura di generazione, verifica e perfezionamento per produrre e migliorare le dimostrazioni.
Dove si possono consultare i risultati?
Tutti i modelli, i dataset e il codice sono disponibili su Hugging Face. Il checkpoint Nemotron‑3‑Ultra‑CC si può scaricare e il documento sulle IOI descrive la metodologia GenCorrect. Il progetto sulle IMO include i checkpoint SFT e RL, il benchmark Nemotron‑IMO‑Bench, composto da 200 problemi di livello olimpico, e un repository NeMo‑Skills con la procedura di inferenza e i prompt. Gli autori auspicano che la comunità riutilizzi la «ricetta in quattro parti»: partire da un solido modello di base, selezionare i dati, applicare SFT/RL e affiancare il tutto a un ciclo di inferenza basato sul feedback.
Perché conta
Per gli sviluppatori, i risultati dimostrano che un unico modello di grandi dimensioni può essere trasformato in uno specialista capace di competere con i migliori partecipanti umani, seguendo una ricetta di fine-tuning riproducibile. Questo significa che appassionati e gruppi di ricerca possono realizzare strumenti efficaci per generare codice o scrivere dimostrazioni senza addestrare da zero un nuovo modello di base.