Kısa haber · 1 dk okuma
Ön eğitim kontrol noktalarının eşleştirilmiş reçeteyle karşılaştırılması
Her kontrol noktası için üç aşağı akış aşamasında da (ara eğitim, uzun bağlam uyarlaması ve SFT) aynı öğrenme oranı reçetesi uygulanıyor.
Oossa · Oossa Hakkında
Hangi reçete seçildi?
SFT çarpanını s = 1/3’te sabit tutarak, ara eğitim ve uzun bağlam öğrenme oranı çarpanları olan m ve ℓ’nin {1, 1/3, 1/9} kümesinden alındığı dokuz olası (m, ℓ) kombinasyonunu taradık. Tarama **Cooldown** kontrol noktasında yapıldı ve SFT sonrası toplam kıyaslama puanını en yükseğe çıkaran kombinasyon **(1, 1)(1, 1)** oldu.
Aynı reçete neden tüm kontrol noktalarında kullanılıyor?
Eğitim altyapısındaki kısıtlamalar, her bir ön eğitim kontrol noktası için ayrı bir öğrenme oranı çizelgesini ayarlamamıza engel olduğundan, tüm kontrol noktalarında (Constant, Cooldown ve Merge) **(1, 1)(1, 1)** reçetesini kullandık. Böylece aşağı akış reçetesi *eşleştirilmiş* oluyor ve nihai puanlardaki farklılıklar farklı bir ince ayar çizelgesine değil, temel ön eğitim kontrol noktasına bağlanabiliyor.
Neden önemli
Tüm kontrol noktalarında tek ve en iyi performansı gösteren reçeteyi kullanmak karşılaştırmayı adil kılıyor: değişen tek unsur, aşağı akış öğrenme oranı çizelgesi değil, ön eğitim kontrol noktasının kalitesi oluyor.
Kaynaklar ve referanslar
| # | Kaynak | Yayın | Tarih | Ana fikir |
|---|---|---|---|---|
| 1 | Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack ↗ | Aleph Alpha | 29 Eyl 2026 |
1 kaynak
Son güncelleme:
Oossa · Bülten
Yapay zekâda hafta, anlaşılır dille
Her pazartesi: bilmeye değer haberler, sade bir dille. Ücretsiz, spam yok.