Hugging Face के मुताबिक, उसके Nemotron‑3 फ़ाउंडेशन मॉडल के दो विशेष संस्करणों ने 2026 के International Olympiad in Informatics (IOI) और 2026 के International Mathematical Olympiad (IMO) में स्वर्ण पदक के स्तर के अंक हासिल किए। IOI के लिए बनाए गए Nemotron‑3‑Ultra‑CC ने 600 में से 535.4 अंक पाए। यह स्वर्ण पदक की 361.12 अंकों की सीमा से काफी अधिक था और शीर्ष मानव प्रतिभागी के 498.27 अंकों से भी ज्यादा था। IMO के लिए Nemotron‑3‑Ultra को supervised fine-tuning (SFT) और reinforcement learning (RL), दोनों से प्रशिक्षित किया गया। इस प्रणाली ने 42 में से 30 अंक हासिल किए, जो आधिकारिक स्वर्ण पदक सीमा 29 से थोड़ा अधिक है।
शोधकर्ताओं ने क्या किया?
दोनों परियोजनाओं में Nemotron‑3 के बड़े बेस मॉडल से शुरुआत की गई, संबंधित क्षेत्रों की समस्याएं जुटाई गईं और प्रशिक्षण के बाद की मानक विधियां अपनाई गईं। IOI के लिए शोधकर्ताओं ने प्रोग्रामिंग की 22,000 चुनौतियां चुनीं और कृत्रिम रूप से तैयार की गई तर्क-प्रक्रियाएं जोड़ीं। फिर SFT और, छोटे Nano मॉडल के लिए, RL का इस्तेमाल किया। उन्होंने GenCorrect नाम का एक इन्फ़रेंस चक्र भी अपनाया, जो जवाब तैयार करता है, उनका मूल्यांकन करता है और उन्हें बेहतर बनाता है। IMO के लिए उन्होंने प्रमाण तैयार करने, उनकी समीक्षा करने और सत्यापन से जुड़े 414,890 छांटे गए उदाहरणों का संग्रह बनाया। इसके बाद एक चेकपॉइंट को SFT और दूसरे को RL से प्रशिक्षित किया। अंतिम IMO प्रणाली में दोनों चेकपॉइंट को सामान्य मॉडल के साथ जोड़ा गया और प्रमाण तैयार करने, सत्यापित करने व सुधारने की प्रक्रिया अपनाई गई।
दूसरे लोग यह काम कहां देख सकते हैं?
सभी मॉडल, डेटासेट और कोड Hugging Face पर जारी किए गए हैं। Nemotron‑3‑Ultra‑CC चेकपॉइंट डाउनलोड के लिए उपलब्ध है और IOI का शोधपत्र GenCorrect की कार्यप्रणाली बताता है। IMO परियोजना में SFT और RL चेकपॉइंट, ओलंपियाड स्तर की 200 समस्याओं वाला Nemotron‑IMO‑Bench बेंचमार्क और इन्फ़रेंस प्रक्रिया व प्रॉम्प्ट वाला NeMo‑Skills रिपॉज़िटरी शामिल है। लेखकों को उम्मीद है कि समुदाय इस “चार हिस्सों वाली विधि” को अपनाएगा—एक मजबूत बेस मॉडल से शुरुआत, डेटा का चयन, SFT/RL और फीडबैक से जवाब बेहतर बनाने वाला इन्फ़रेंस चक्र।
यह क्यों मायने रखता है
डेवलपरों के लिए ये नतीजे दिखाते हैं कि एक बड़े मॉडल को दोबारा इस्तेमाल की जा सकने वाली फाइन-ट्यूनिंग विधि से विशेषज्ञ प्रणाली में बदला जा सकता है, जो शीर्ष मानव प्रतिभागियों के स्तर का प्रदर्शन करे। इससे शौकिया डेवलपर और शोध दल नया फ़ाउंडेशन मॉडल शुरू से प्रशिक्षित किए बिना कोड बनाने या गणितीय प्रमाण लिखने वाले बेहतर टूल तैयार कर सकते हैं।