A Hugging Face informa que duas versões especializadas de seu modelo fundacional Nemotron‑3 obtiveram pontuações de medalha de ouro na Olimpíada Internacional de Informática (IOI) de 2026 e na Olimpíada Internacional de Matemática (IMO) de 2026. O sistema da IOI, chamado Nemotron‑3‑Ultra‑CC, fez 535,4 de 600 pontos, bem acima dos 361,12 pontos necessários para o ouro e também acima da maior pontuação humana, de 498,27. O sistema da IMO, desenvolvido a partir do Nemotron‑3‑Ultra com ajuste fino supervisionado (SFT) e aprendizado por reforço (RL), fez 30 de 42 pontos, pouco acima da nota de corte oficial para o ouro, de 29.
O que os pesquisadores fizeram?
Os dois projetos partiram de um modelo-base Nemotron‑3 de grande porte, reuniram problemas específicos de cada área e aplicaram métodos convencionais de pós-treinamento. Para a IOI, os pesquisadores selecionaram 22.000 desafios de programação e acrescentaram etapas de raciocínio sintéticas; depois, aplicaram SFT e, no modelo Nano, menor, RL. Também usaram um ciclo de inferência chamado GenCorrect, que gera, avalia e aprimora respostas. Para a IMO, reuniram um corpus de 414.890 exemplos de demonstrações filtrados, abrangendo geração, crítica e verificação, e ajustaram um checkpoint com SFT e outro com RL. O sistema final da IMO combinou os dois checkpoints com o modelo geral e executou um processo de geração, verificação e refinamento para produzir e melhorar demonstrações.
Onde encontrar o trabalho?
Todos os modelos, conjuntos de dados e códigos foram disponibilizados na Hugging Face. O checkpoint Nemotron‑3‑Ultra‑CC pode ser baixado, e o artigo sobre a IOI descreve a metodologia GenCorrect. O projeto da IMO inclui os checkpoints de SFT e RL, o benchmark Nemotron‑IMO‑Bench, com 200 problemas de nível olímpico, e um repositório NeMo‑Skills com o processo de inferência e os prompts. Os autores esperam que a comunidade reaproveite a “receita de quatro etapas”: começar com uma base sólida, selecionar dados, aplicar SFT/RL e combinar isso com um ciclo de inferência orientado por feedback.
Por que importa
Para desenvolvedores, os resultados mostram que é possível transformar um único modelo de grande porte em um especialista capaz de rivalizar com os melhores competidores humanos, usando uma receita de ajuste fino reproduzível. Isso significa que entusiastas e equipes de pesquisa podem criar ferramentas de alto desempenho para geração de código ou redação de demonstrações sem treinar do zero um novo modelo fundacional.