خبر کوتاه · 1 دقیقه مطالعه
مقایسه چکپوینتهای پیشآموزش با دستورالعمل آموزشی یکسان
هر سه مرحلهٔ پس از پیشآموزش (آموزش میانی، سازگارسازی با بافت بلند و SFT) برای هر چکپوینت با دستورالعمل نرخ یادگیری یکسان اجرا میشوند.
Oossa · درباره Oossa
چه دستورالعملی انتخاب شد
نه ترکیب ممکنِ (m، ℓ) را بررسی کردیم؛ در این ترکیبها، m و ℓ بهترتیب ضریب نرخ یادگیری در آموزش میانی و سازگارسازی با بافت بلند هستند و از مجموعهٔ {1، 1/3، 1/9} انتخاب میشوند. در این بررسی، ضریب SFT ثابت و برابر با s = 1/3 بود. آزمایش روی چکپوینت **Cooldown** انجام شد و ترکیبی که بالاترین امتیاز تجمیعی بنچمارک را پس از SFT به دست آورد، **(1, 1)(1, 1)** بود.
چرا از دستورالعمل یکسانی برای همهٔ چکپوینتها استفاده میشود
محدودیتهای زیرساخت آموزشی اجازه نمیداد برای هر چکپوینت پیشآموزش، برنامهٔ نرخ یادگیری جداگانهای تنظیم کنیم؛ بنابراین دستورالعمل **(1, 1)(1, 1)** را برای همهٔ چکپوینتها (Constant، Cooldown و Merge) به کار بردیم. به این ترتیب، دستورالعمل پس از پیشآموزش برای همه یکسان است و میتوان تفاوت امتیازهای نهایی را به چکپوینت پیشآموزش نسبت داد، نه به تفاوت در برنامهٔ ریزتنظیم.
چرا مهم است
استفاده از یک دستورالعمل واحد و موفق برای همهٔ چکپوینتها، مقایسه را منصفانه میکند: تنها متغیر، کیفیت خود چکپوینت پیشآموزش است، نه برنامهٔ نرخ یادگیری در مراحل بعدی.
منابع و ارجاعها
| # | منبع | رسانه | تاریخ | نکته اصلی |
|---|---|---|---|---|
| 1 | Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack ↗ | Aleph Alpha | ۷ مهر ۱۴۰۵ |
1 منبع
آخرین بهروزرسانی:
Oossa · خبرنامه
هفتهٔ هوش مصنوعی، به زبان ساده
هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.