Oossa

Nemotron模型在IOI和IMO竞赛中达到金牌水平

经过微调的Nemotron‑3变体在2026年国际信息学奥林匹克和国际数学奥林匹克中取得超过金牌线的成绩。

作者: Oossa 发布日期: 1 分钟阅读

Nikita Kachanovsky · Unsplash

Hugging Face表示,其Nemotron‑3基础模型的两个专用版本在2026年国际信息学奥林匹克(IOI)和2026年国际数学奥林匹克(IMO)中获得了金牌成绩。名为Nemotron‑3‑Ultra‑CC的IOI系统得分535.4/600,远超361.12分的金牌线,也高于人类选手498.27分的最高成绩。IMO系统基于Nemotron‑3‑Ultra构建,采用了监督微调(SFT)和强化学习(RL),得分30/42,略高于29分的官方金牌线。

研究人员做了什么?

两个项目都以大型Nemotron‑3基础模型为起点,收集特定领域的问题,并采用常见的后训练方法。针对IOI,研究人员整理了22,000道编程题,并加入合成推理过程,随后进行SFT;对于较小的Nano模型,还采用了RL。他们还使用了名为GenCorrect的推理循环,用于生成、评估和改进答案。针对IMO,研究人员整理了包含414,890个经过筛选的证明示例的数据集,涵盖证明生成、评议和验证,然后分别用SFT和RL微调两个检查点。最终的IMO系统将这两个检查点与通用模型结合,通过“生成—验证—改进”流程生成并完善证明。

其他人在哪里可以找到相关成果?

所有模型、数据集和代码均已在Hugging Face上发布。Nemotron‑3‑Ultra‑CC检查点可供下载,IOI论文则介绍了GenCorrect方法。IMO项目包含SFT和RL检查点、由200道奥林匹克竞赛级别题目组成的Nemotron‑IMO‑Bench基准,以及提供推理流程和提示词的NeMo‑Skills代码库。作者希望社区能够复用这套“四步方案”——从强大的基础模型出发、整理数据、应用SFT/RL,并配合由反馈驱动的推理循环。

为什么重要

对开发者而言,这些结果表明,通过一套可复现的微调方案,可以将单个大型模型改造成专用模型,使其达到顶尖人类选手的水平。这意味着爱好者和研究团队无需从头训练新的基础模型,也能打造高性能的代码生成或证明撰写工具。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。