# مقایسه چک‌پوینت‌های پیش‌آموزش با دستورالعمل آموزشی یکسان

> هر سه مرحلهٔ پس از پیش‌آموزش (آموزش میانی، سازگارسازی با بافت بلند و SFT) برای هر چک‌پوینت با دستورالعمل نرخ یادگیری یکسان اجرا می‌شوند.

Oossa · 2026-09-29 · https://oossa.com/fa/matched-recipe-comparison-of-pre-training-checkpoints

## چه دستورالعملی انتخاب شد

نه ترکیب ممکنِ (m، ℓ) را بررسی کردیم؛ در این ترکیب‌ها، m و ℓ به‌ترتیب ضریب نرخ یادگیری در آموزش میانی و سازگارسازی با بافت بلند هستند و از مجموعهٔ {1، 1/3، 1/9} انتخاب می‌شوند. در این بررسی، ضریب SFT ثابت و برابر با s = 1/3 بود. آزمایش روی چک‌پوینت **Cooldown** انجام شد و ترکیبی که بالاترین امتیاز تجمیعی بنچمارک را پس از SFT به دست آورد، **(1, 1)(1, 1)** بود.

## چرا از دستورالعمل یکسانی برای همهٔ چک‌پوینت‌ها استفاده می‌شود

محدودیت‌های زیرساخت آموزشی اجازه نمی‌داد برای هر چک‌پوینت پیش‌آموزش، برنامهٔ نرخ یادگیری جداگانه‌ای تنظیم کنیم؛ بنابراین دستورالعمل **(1, 1)(1, 1)** را برای همهٔ چک‌پوینت‌ها (Constant، Cooldown و Merge) به کار بردیم. به این ترتیب، دستورالعمل پس از پیش‌آموزش برای همه یکسان است و می‌توان تفاوت امتیازهای نهایی را به چک‌پوینت پیش‌آموزش نسبت داد، نه به تفاوت در برنامهٔ ریزتنظیم.

## حقایق

- ضریب آموزش میانی m = 1
- ضریب سازگارسازی با بافت بلند ℓ = 1
- ضریب SFT برابر با s = 1/3 است
- این دستورالعمل انتخاب شد چون روی چک‌پوینت Cooldown بالاترین امتیاز تجمیعی را پس از SFT به دست آورد. 

## چرا مهم است

استفاده از یک دستورالعمل واحد و موفق برای همهٔ چک‌پوینت‌ها، مقایسه را منصفانه می‌کند: تنها متغیر، کیفیت خود چک‌پوینت پیش‌آموزش است، نه برنامهٔ نرخ یادگیری در مراحل بعدی.

## منابع و ارجاع‌ها

1. [Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack](https://www.aleph-alpha.com/en/blog/good-pretraining-bad-sft/) – Aleph Alpha, 2026-09-29

آخرین به‌روزرسانی: 2026-09-29
