Oossa

مدل‌های Nemotron در المپیادهای برنامه‌نویسی و ریاضی طلا گرفتند

نسخه‌های تنظیم‌دقیق‌شده Nemotron‑3 در المپیادهای جهانی برنامه‌نویسی و ریاضی 2026 از حدنصاب مدال طلا عبور کردند.

نویسنده: منتشرشده توسط Oossa: 1 دقیقه مطالعه

Nikita Kachanovsky · Unsplash

Hugging Face اعلام کرده است که دو نسخه تخصصی از مدل پایه Nemotron‑3 این شرکت در المپیاد جهانی برنامه‌نویسی (IOI) و المپیاد جهانی ریاضی (IMO) سال 2026 امتیاز مدال طلا کسب کرده‌اند. سامانه IOI که Nemotron‑3‑Ultra‑CC نام دارد، از 600 امتیاز ممکن 535.4 امتیاز گرفت؛ امتیازی که بسیار بالاتر از حدنصاب طلا، یعنی 361.12، و همچنین بیشتر از امتیاز برتر شرکت‌کنندگان انسانی، یعنی 498.27، است. سامانه IMO که با تنظیم‌دقیق نظارت‌شده (SFT) و یادگیری تقویتی (RL) از Nemotron‑3‑Ultra ساخته شده، 30 امتیاز از 42 امتیاز کسب کرد؛ کمی بیشتر از حدنصاب رسمی طلا که 29 امتیاز بود.

پژوهشگران چه کردند؟

هر دو پروژه با یک مدل پایه بزرگ Nemotron‑3 آغاز شدند؛ پژوهشگران مسائل تخصصی گردآوری کردند و سپس روش‌های متداول پس‌آموزش را به کار گرفتند. برای IOI، آن‌ها 22,000 چالش برنامه‌نویسی را گزینش کردند، ردهای استدلالی مصنوعی افزودند و سپس تنظیم‌دقیق نظارت‌شده (SFT) را انجام دادند و برای مدل کوچک‌تر Nano، یادگیری تقویتی (RL) را نیز به کار گرفتند. همچنین از حلقه استنتاجی GenCorrect استفاده کردند که پاسخ‌ها را تولید، ارزیابی و اصلاح می‌کند. برای IMO، مجموعه‌ای شامل 414,890 نمونه برهانِ پالایش‌شده گردآوری کردند که تولید، نقد و راستی‌آزمایی برهان را پوشش می‌داد. سپس یک چک‌پوینت را با SFT و چک‌پوینت دیگری را با RL تنظیم‌دقیق کردند. سامانه نهایی IMO این دو چک‌پوینت را با مدل عمومی ترکیب کرد و با اجرای فرایند تولید، راستی‌آزمایی و اصلاح، برهان‌ها را تولید و بهبود داد.

دیگران از کجا می‌توانند به این کار دسترسی پیدا کنند؟

همه مدل‌ها، مجموعه‌داده‌ها و کدها در Hugging Face منتشر شده‌اند. چک‌پوینت Nemotron‑3‑Ultra‑CC برای دانلود در دسترس است و مقاله IOI روش GenCorrect را شرح می‌دهد. پروژه IMO نیز چک‌پوینت‌های SFT و RL، معیار سنجش Nemotron‑IMO‑Bench شامل 200 مسئله در سطح المپیاد و مخزن NeMo‑Skills را دربر می‌گیرد که خط لوله استنتاج و پرامپت‌ها در آن قرار دارند. نویسندگان امیدوارند جامعه پژوهشی از «دستورالعمل چهارمرحله‌ای» آن‌ها استفاده کند: شروع با یک مدل پایه قدرتمند، گزینش داده‌ها، به‌کارگیری SFT/RL و ترکیب آن با حلقه استنتاجی مبتنی بر بازخورد.

چرا مهم است

برای توسعه‌دهندگان، این نتایج نشان می‌دهد می‌توان با روشی تکرارپذیر برای تنظیم‌دقیق، یک مدل بزرگ را به متخصصی تبدیل کرد که با برترین شرکت‌کنندگان انسانی رقابت می‌کند. در نتیجه، علاقه‌مندان و گروه‌های پژوهشی می‌توانند بدون آموزش یک مدل پایه از ابتدا، ابزارهای قدرتمندی برای تولید کد یا نوشتن برهان بسازند.

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.