По данным Hugging Face, две специализированные версии базовой модели Nemotron‑3 набрали баллы, соответствующие золотой медали, на Международной олимпиаде по информатике (IOI) и Международной математической олимпиаде (IMO) 2026 года. Система для IOI под названием Nemotron‑3‑Ultra‑CC набрала 535.4 из 600 баллов — значительно выше золотого порога в 361.12 балла и больше, чем лучший результат участника-человека — 498.27. Система для IMO, созданная на основе Nemotron‑3‑Ultra с использованием контролируемого дообучения (SFT) и обучения с подкреплением (RL), набрала 30 из 42 баллов, лишь немного превысив официальный порог для золотой медали — 29 баллов.
Что сделали исследователи?
Оба проекта начались с большой базовой модели Nemotron‑3: исследователи собрали задачи по профильным предметам и применили стандартные методы дообучения. Для IOI они отобрали 22,000 задач по программированию и добавили синтетические цепочки рассуждений, а затем использовали SFT и RL для более компактной модели Nano. Кроме того, они применили цикл инференса GenCorrect, который генерирует, оценивает и дорабатывает ответы. Для IMO исследователи собрали корпус из 414,890 отфильтрованных примеров доказательств, охватывающих построение, критику и проверку доказательств, а затем дообучили один чекпойнт с помощью SFT, а другой — с помощью RL. Итоговая система для IMO объединила оба чекпойнта с общей моделью и использовала конвейер «построение — проверка — доработка», чтобы создавать и улучшать доказательства.
Где ознакомиться с результатами?
Все модели, наборы данных и код опубликованы на Hugging Face. Чекпойнт Nemotron‑3‑Ultra‑CC можно скачать, а в статье об IOI описана методика GenCorrect. В проекте IMO доступны чекпойнты SFT и RL, бенчмарк Nemotron‑IMO‑Bench с 200 задачами олимпиадного уровня и репозиторий NeMo‑Skills с конвейером инференса и промптами. Авторы надеются, что сообщество воспользуется их «рецептом из четырех частей»: взять мощную базовую модель, подготовить данные, применить SFT/RL и добавить цикл инференса с обратной связью.
Почему это важно
Для разработчиков эти результаты показывают, что большую модель можно превратить в узкоспециализированную систему, способную конкурировать с сильнейшими участниками-людьми, используя воспроизводимый подход к дообучению. Это значит, что энтузиасты и исследовательские команды могут создавать эффективные инструменты для генерации кода или написания доказательств, не обучая базовую модель с нуля.