Oossaهوش مصنوعی به‌سرعت پیشرفت می‌کند. ما آن را ساده توضیح می‌دهیم.
خبرنامه

خبر کوتاه · 1 دقیقه مطالعه

مقایسه چک‌پوینت‌های پیش‌آموزش با دستورالعمل آموزشی یکسان

هر سه مرحلهٔ پس از پیش‌آموزش (آموزش میانی، سازگارسازی با بافت بلند و SFT) برای هر چک‌پوینت با دستورالعمل نرخ یادگیری یکسان اجرا می‌شوند.

Oossa · درباره Oossa

چه دستورالعملی انتخاب شد

نه ترکیب ممکنِ (m، ℓ) را بررسی کردیم؛ در این ترکیب‌ها، m و ℓ به‌ترتیب ضریب نرخ یادگیری در آموزش میانی و سازگارسازی با بافت بلند هستند و از مجموعهٔ {1، 1/3، 1/9} انتخاب می‌شوند. در این بررسی، ضریب SFT ثابت و برابر با s = 1/3 بود. آزمایش روی چک‌پوینت **Cooldown** انجام شد و ترکیبی که بالاترین امتیاز تجمیعی بنچمارک را پس از SFT به دست آورد، **(1, 1)(1, 1)** بود.

چرا از دستورالعمل یکسانی برای همهٔ چک‌پوینت‌ها استفاده می‌شود

محدودیت‌های زیرساخت آموزشی اجازه نمی‌داد برای هر چک‌پوینت پیش‌آموزش، برنامهٔ نرخ یادگیری جداگانه‌ای تنظیم کنیم؛ بنابراین دستورالعمل **(1, 1)(1, 1)** را برای همهٔ چک‌پوینت‌ها (Constant، Cooldown و Merge) به کار بردیم. به این ترتیب، دستورالعمل پس از پیش‌آموزش برای همه یکسان است و می‌توان تفاوت امتیازهای نهایی را به چک‌پوینت پیش‌آموزش نسبت داد، نه به تفاوت در برنامهٔ ریزتنظیم.

چرا مهم است

استفاده از یک دستورالعمل واحد و موفق برای همهٔ چک‌پوینت‌ها، مقایسه را منصفانه می‌کند: تنها متغیر، کیفیت خود چک‌پوینت پیش‌آموزش است، نه برنامهٔ نرخ یادگیری در مراحل بعدی.

آیا این مقاله مفید بود؟

منابع و ارجاع‌ها

#منبعرسانهتاریخنکته اصلی
1Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack ↗Aleph Alpha۷ مهر ۱۴۰۵

1 منبع

آخرین به‌روزرسانی:

Oossallms.txt.md

اشتراک‌گذاری

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.