Oossa

Nemotron मॉडल ने IOI और IMO में जीते स्वर्ण स्तर के अंक

Nemotron‑3 के खास तौर पर प्रशिक्षित संस्करणों ने 2026 के International Olympiad in Informatics और International Mathematical Olympiad में स्वर्ण पदक की सीमा पार की।

लेखक: Oossa द्वारा प्रकाशित: 1 मिनट पढ़ना

Nikita Kachanovsky · Unsplash

Hugging Face के मुताबिक, उसके Nemotron‑3 फ़ाउंडेशन मॉडल के दो विशेष संस्करणों ने 2026 के International Olympiad in Informatics (IOI) और 2026 के International Mathematical Olympiad (IMO) में स्वर्ण पदक के स्तर के अंक हासिल किए। IOI के लिए बनाए गए Nemotron‑3‑Ultra‑CC ने 600 में से 535.4 अंक पाए। यह स्वर्ण पदक की 361.12 अंकों की सीमा से काफी अधिक था और शीर्ष मानव प्रतिभागी के 498.27 अंकों से भी ज्यादा था। IMO के लिए Nemotron‑3‑Ultra को supervised fine-tuning (SFT) और reinforcement learning (RL), दोनों से प्रशिक्षित किया गया। इस प्रणाली ने 42 में से 30 अंक हासिल किए, जो आधिकारिक स्वर्ण पदक सीमा 29 से थोड़ा अधिक है।

शोधकर्ताओं ने क्या किया?

दोनों परियोजनाओं में Nemotron‑3 के बड़े बेस मॉडल से शुरुआत की गई, संबंधित क्षेत्रों की समस्याएं जुटाई गईं और प्रशिक्षण के बाद की मानक विधियां अपनाई गईं। IOI के लिए शोधकर्ताओं ने प्रोग्रामिंग की 22,000 चुनौतियां चुनीं और कृत्रिम रूप से तैयार की गई तर्क-प्रक्रियाएं जोड़ीं। फिर SFT और, छोटे Nano मॉडल के लिए, RL का इस्तेमाल किया। उन्होंने GenCorrect नाम का एक इन्फ़रेंस चक्र भी अपनाया, जो जवाब तैयार करता है, उनका मूल्यांकन करता है और उन्हें बेहतर बनाता है। IMO के लिए उन्होंने प्रमाण तैयार करने, उनकी समीक्षा करने और सत्यापन से जुड़े 414,890 छांटे गए उदाहरणों का संग्रह बनाया। इसके बाद एक चेकपॉइंट को SFT और दूसरे को RL से प्रशिक्षित किया। अंतिम IMO प्रणाली में दोनों चेकपॉइंट को सामान्य मॉडल के साथ जोड़ा गया और प्रमाण तैयार करने, सत्यापित करने व सुधारने की प्रक्रिया अपनाई गई।

दूसरे लोग यह काम कहां देख सकते हैं?

सभी मॉडल, डेटासेट और कोड Hugging Face पर जारी किए गए हैं। Nemotron‑3‑Ultra‑CC चेकपॉइंट डाउनलोड के लिए उपलब्ध है और IOI का शोधपत्र GenCorrect की कार्यप्रणाली बताता है। IMO परियोजना में SFT और RL चेकपॉइंट, ओलंपियाड स्तर की 200 समस्याओं वाला Nemotron‑IMO‑Bench बेंचमार्क और इन्फ़रेंस प्रक्रिया व प्रॉम्प्ट वाला NeMo‑Skills रिपॉज़िटरी शामिल है। लेखकों को उम्मीद है कि समुदाय इस “चार हिस्सों वाली विधि” को अपनाएगा—एक मजबूत बेस मॉडल से शुरुआत, डेटा का चयन, SFT/RL और फीडबैक से जवाब बेहतर बनाने वाला इन्फ़रेंस चक्र।

यह क्यों मायने रखता है

डेवलपरों के लिए ये नतीजे दिखाते हैं कि एक बड़े मॉडल को दोबारा इस्तेमाल की जा सकने वाली फाइन-ट्यूनिंग विधि से विशेषज्ञ प्रणाली में बदला जा सकता है, जो शीर्ष मानव प्रतिभागियों के स्तर का प्रदर्शन करे। इससे शौकिया डेवलपर और शोध दल नया फ़ाउंडेशन मॉडल शुरू से प्रशिक्षित किए बिना कोड बनाने या गणितीय प्रमाण लिखने वाले बेहतर टूल तैयार कर सकते हैं।

क्या यह लेख उपयोगी था?
साझा करें

यह भी पढ़ें

Oossa · न्यूज़लेटर

AI का हफ़्ता, आसान भाषा में

हर सोमवार: जानने लायक खबरें, सरल भाषा में। मुफ़्त, कोई स्पैम नहीं।