OossaAI तेज़ी से विकसित हो रहा है। हम इसे आसान भाषा में समझाते हैं।
न्यूज़लेटर

संक्षिप्त · 1 मिनट पढ़ना

प्री-ट्रेनिंग चेकपॉइंट्स की समान रेसिपी के साथ तुलना

हर चेकपॉइंट के लिए डाउनस्ट्रीम के तीनों चरण (मिड-ट्रेनिंग, लॉन्ग-कॉन्टेक्स्ट अडैप्टेशन और SFT) में एक ही लर्निंग-रेट रेसिपी अपनाई गई।

Oossa · Oossa के बारे में

कौन-सी रेसिपी चुनी गई

हमने नौ संभावित ( m, ℓ ) संयोजनों को आज़माया—जहाँ m और ℓ क्रमशः मिड-ट्रेनिंग और लॉन्ग-कॉन्टेक्स्ट के लर्निंग-रेट फ़ैक्टर हैं और दोनों के मान {1, 1/3, 1/9} में से लिए गए—जबकि SFT फ़ैक्टर को s = 1/3 पर स्थिर रखा। यह परीक्षण **Cooldown** चेकपॉइंट पर किया गया और SFT के बाद बेंचमार्क के कुल स्कोर में सबसे बेहतर नतीजा देने वाला संयोजन **(1, 1)(1, 1)** था।

सभी चेकपॉइंट्स के लिए एक ही रेसिपी क्यों अपनाई गई

ट्रेनिंग इंफ्रास्ट्रक्चर की सीमाओं के कारण हम हर प्री-ट्रेनिंग चेकपॉइंट के लिए अलग लर्निंग-रेट शेड्यूल का परीक्षण नहीं कर सके। इसलिए हमने सभी चेकपॉइंट्स (Constant, Cooldown और Merge) के लिए **(1, 1)(1, 1)** रेसिपी अपनाई। इससे डाउनस्ट्रीम रेसिपी *एक समान* रहती है और अंतिम स्कोर में किसी भी अंतर का कारण अलग फ़ाइन-ट्यूनिंग शेड्यूल के बजाय संबंधित प्री-ट्रेनिंग चेकपॉइंट होता है।

यह क्यों मायने रखता है

सभी चेकपॉइंट्स पर सबसे अच्छा प्रदर्शन करने वाली एक ही रेसिपी अपनाने से तुलना निष्पक्ष रहती है: एकमात्र बदलने वाला पहलू प्री-ट्रेनिंग चेकपॉइंट की गुणवत्ता है, डाउनस्ट्रीम लर्निंग-रेट शेड्यूल नहीं।

क्या यह लेख उपयोगी था?

स्रोत और संदर्भ

#स्रोतप्रकाशकतारीखमुख्य बात
1Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack ↗Aleph Alpha29 सित॰ 2026

1 स्रोत

अंतिम अपडेट:

Oossallms.txt.md

साझा करें

Oossa · न्यूज़लेटर

AI का हफ़्ता, आसान भाषा में

हर सोमवार: जानने लायक खबरें, सरल भाषा में। मुफ़्त, कोई स्पैम नहीं।