# प्री-ट्रेनिंग चेकपॉइंट्स की समान रेसिपी के साथ तुलना

> हर चेकपॉइंट के लिए डाउनस्ट्रीम के तीनों चरण (मिड-ट्रेनिंग, लॉन्ग-कॉन्टेक्स्ट अडैप्टेशन और SFT) में एक ही लर्निंग-रेट रेसिपी अपनाई गई।

Oossa · 2026-09-29 · https://oossa.com/hi/matched-recipe-comparison-of-pre-training-checkpoints

## कौन-सी रेसिपी चुनी गई

हमने नौ संभावित ( m, ℓ ) संयोजनों को आज़माया—जहाँ m और ℓ क्रमशः मिड-ट्रेनिंग और लॉन्ग-कॉन्टेक्स्ट के लर्निंग-रेट फ़ैक्टर हैं और दोनों के मान {1, 1/3, 1/9} में से लिए गए—जबकि SFT फ़ैक्टर को s = 1/3 पर स्थिर रखा। यह परीक्षण **Cooldown** चेकपॉइंट पर किया गया और SFT के बाद बेंचमार्क के कुल स्कोर में सबसे बेहतर नतीजा देने वाला संयोजन **(1, 1)(1, 1)** था।

## सभी चेकपॉइंट्स के लिए एक ही रेसिपी क्यों अपनाई गई

ट्रेनिंग इंफ्रास्ट्रक्चर की सीमाओं के कारण हम हर प्री-ट्रेनिंग चेकपॉइंट के लिए अलग लर्निंग-रेट शेड्यूल का परीक्षण नहीं कर सके। इसलिए हमने सभी चेकपॉइंट्स (Constant, Cooldown और Merge) के लिए **(1, 1)(1, 1)** रेसिपी अपनाई। इससे डाउनस्ट्रीम रेसिपी *एक समान* रहती है और अंतिम स्कोर में किसी भी अंतर का कारण अलग फ़ाइन-ट्यूनिंग शेड्यूल के बजाय संबंधित प्री-ट्रेनिंग चेकपॉइंट होता है।

## तथ्य

- मिड-ट्रेनिंग फ़ैक्टर m = 1
- लॉन्ग-कॉन्टेक्स्ट फ़ैक्टर ℓ = 1
- SFT फ़ैक्टर s = 1/3
- इसे इसलिए चुना गया क्योंकि Cooldown चेकपॉइंट पर SFT के बाद इसका कुल स्कोर सबसे बेहतर था।

## यह क्यों मायने रखता है

सभी चेकपॉइंट्स पर सबसे अच्छा प्रदर्शन करने वाली एक ही रेसिपी अपनाने से तुलना निष्पक्ष रहती है: एकमात्र बदलने वाला पहलू प्री-ट्रेनिंग चेकपॉइंट की गुणवत्ता है, डाउनस्ट्रीम लर्निंग-रेट शेड्यूल नहीं।

## स्रोत और संदर्भ

1. [Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack](https://www.aleph-alpha.com/en/blog/good-pretraining-bad-sft/) – Aleph Alpha, 2026-09-29

अंतिम अपडेट: 2026-09-29
