Hugging Face informa que dos versiones especializadas de su modelo fundacional Nemotron‑3 obtuvieron puntuaciones de medalla de oro en la Olimpiada Internacional de Informática (IOI) de 2026 y en la Olimpiada Internacional de Matemáticas (IMO) de 2026. El sistema para la IOI, llamado Nemotron‑3‑Ultra‑CC, logró 535.4 de 600 puntos, muy por encima del umbral del oro, de 361.12, y por encima de la puntuación más alta obtenida por una persona, de 498.27. El sistema para la IMO, desarrollado a partir de Nemotron‑3‑Ultra mediante ajuste fino supervisado (SFT) y aprendizaje por refuerzo (RL), obtuvo 30 de 42 puntos, apenas por encima del corte oficial para el oro, de 29.
¿Qué hicieron los investigadores?
Ambos proyectos partieron de un modelo base grande de Nemotron‑3, recopilaron problemas específicos de cada disciplina y aplicaron métodos habituales de posentrenamiento. Para la IOI, seleccionaron 22,000 retos de programación y añadieron trazas sintéticas de razonamiento; después aplicaron SFT y, al modelo Nano, que es más pequeño, también RL. Además, usaron un ciclo de inferencia llamado GenCorrect, que genera, evalúa y perfecciona las respuestas. Para la IMO, reunieron un corpus de 414,890 ejemplos de demostraciones filtrados, que abarcaban la generación, la crítica y la verificación. Luego ajustaron un punto de control con SFT y otro con RL. El sistema final para la IMO combinó ambos puntos de control con el modelo general y ejecutó un proceso de generación, verificación y perfeccionamiento para producir y mejorar las demostraciones.
¿Dónde se puede consultar el trabajo?
Todos los modelos, conjuntos de datos y códigos están disponibles en Hugging Face. El punto de control Nemotron‑3‑Ultra‑CC se puede descargar, y el artículo sobre la IOI describe la metodología GenCorrect. El proyecto de la IMO incluye los puntos de control de SFT y RL, el benchmark Nemotron‑IMO‑Bench, con 200 problemas de nivel olímpico, y un repositorio de NeMo‑Skills con el proceso de inferencia y las instrucciones. Los autores esperan que la comunidad reutilice la «receta de cuatro partes»: partir de un modelo base sólido, seleccionar los datos, aplicar SFT/RL y combinarlo con un ciclo de inferencia guiado por retroalimentación.
Por qué importa
Para los desarrolladores, estos resultados muestran que es posible convertir un único modelo grande en un especialista capaz de competir con los mejores participantes humanos mediante una receta de ajuste fino reproducible. Esto significa que aficionados y equipos de investigación pueden crear herramientas de alto rendimiento para generar código o redactar demostraciones sin entrenar desde cero un nuevo modelo fundacional.