Hugging Face اعلام کرده است که دو نسخه تخصصی از مدل پایه Nemotron‑3 این شرکت در المپیاد جهانی برنامهنویسی (IOI) و المپیاد جهانی ریاضی (IMO) سال 2026 امتیاز مدال طلا کسب کردهاند. سامانه IOI که Nemotron‑3‑Ultra‑CC نام دارد، از 600 امتیاز ممکن 535.4 امتیاز گرفت؛ امتیازی که بسیار بالاتر از حدنصاب طلا، یعنی 361.12، و همچنین بیشتر از امتیاز برتر شرکتکنندگان انسانی، یعنی 498.27، است. سامانه IMO که با تنظیمدقیق نظارتشده (SFT) و یادگیری تقویتی (RL) از Nemotron‑3‑Ultra ساخته شده، 30 امتیاز از 42 امتیاز کسب کرد؛ کمی بیشتر از حدنصاب رسمی طلا که 29 امتیاز بود.
پژوهشگران چه کردند؟
هر دو پروژه با یک مدل پایه بزرگ Nemotron‑3 آغاز شدند؛ پژوهشگران مسائل تخصصی گردآوری کردند و سپس روشهای متداول پسآموزش را به کار گرفتند. برای IOI، آنها 22,000 چالش برنامهنویسی را گزینش کردند، ردهای استدلالی مصنوعی افزودند و سپس تنظیمدقیق نظارتشده (SFT) را انجام دادند و برای مدل کوچکتر Nano، یادگیری تقویتی (RL) را نیز به کار گرفتند. همچنین از حلقه استنتاجی GenCorrect استفاده کردند که پاسخها را تولید، ارزیابی و اصلاح میکند. برای IMO، مجموعهای شامل 414,890 نمونه برهانِ پالایششده گردآوری کردند که تولید، نقد و راستیآزمایی برهان را پوشش میداد. سپس یک چکپوینت را با SFT و چکپوینت دیگری را با RL تنظیمدقیق کردند. سامانه نهایی IMO این دو چکپوینت را با مدل عمومی ترکیب کرد و با اجرای فرایند تولید، راستیآزمایی و اصلاح، برهانها را تولید و بهبود داد.
دیگران از کجا میتوانند به این کار دسترسی پیدا کنند؟
همه مدلها، مجموعهدادهها و کدها در Hugging Face منتشر شدهاند. چکپوینت Nemotron‑3‑Ultra‑CC برای دانلود در دسترس است و مقاله IOI روش GenCorrect را شرح میدهد. پروژه IMO نیز چکپوینتهای SFT و RL، معیار سنجش Nemotron‑IMO‑Bench شامل 200 مسئله در سطح المپیاد و مخزن NeMo‑Skills را دربر میگیرد که خط لوله استنتاج و پرامپتها در آن قرار دارند. نویسندگان امیدوارند جامعه پژوهشی از «دستورالعمل چهارمرحلهای» آنها استفاده کند: شروع با یک مدل پایه قدرتمند، گزینش دادهها، بهکارگیری SFT/RL و ترکیب آن با حلقه استنتاجی مبتنی بر بازخورد.
چرا مهم است
برای توسعهدهندگان، این نتایج نشان میدهد میتوان با روشی تکرارپذیر برای تنظیمدقیق، یک مدل بزرگ را به متخصصی تبدیل کرد که با برترین شرکتکنندگان انسانی رقابت میکند. در نتیجه، علاقهمندان و گروههای پژوهشی میتوانند بدون آموزش یک مدل پایه از ابتدا، ابزارهای قدرتمندی برای تولید کد یا نوشتن برهان بسازند.