OossaYapay zekâ hızla gelişiyor. Biz basitçe anlatıyoruz.
Bülten

Kısa haber · 1 dk okuma

Ön eğitim kontrol noktalarının eşleştirilmiş reçeteyle karşılaştırılması

Her kontrol noktası için üç aşağı akış aşamasında da (ara eğitim, uzun bağlam uyarlaması ve SFT) aynı öğrenme oranı reçetesi uygulanıyor.

Oossa · Oossa Hakkında

Hangi reçete seçildi?

SFT çarpanını s = 1/3’te sabit tutarak, ara eğitim ve uzun bağlam öğrenme oranı çarpanları olan m ve ℓ’nin {1, 1/3, 1/9} kümesinden alındığı dokuz olası (m, ℓ) kombinasyonunu taradık. Tarama **Cooldown** kontrol noktasında yapıldı ve SFT sonrası toplam kıyaslama puanını en yükseğe çıkaran kombinasyon **(1, 1)(1, 1)** oldu.

Aynı reçete neden tüm kontrol noktalarında kullanılıyor?

Eğitim altyapısındaki kısıtlamalar, her bir ön eğitim kontrol noktası için ayrı bir öğrenme oranı çizelgesini ayarlamamıza engel olduğundan, tüm kontrol noktalarında (Constant, Cooldown ve Merge) **(1, 1)(1, 1)** reçetesini kullandık. Böylece aşağı akış reçetesi *eşleştirilmiş* oluyor ve nihai puanlardaki farklılıklar farklı bir ince ayar çizelgesine değil, temel ön eğitim kontrol noktasına bağlanabiliyor.

Neden önemli

Tüm kontrol noktalarında tek ve en iyi performansı gösteren reçeteyi kullanmak karşılaştırmayı adil kılıyor: değişen tek unsur, aşağı akış öğrenme oranı çizelgesi değil, ön eğitim kontrol noktasının kalitesi oluyor.

Bu makale faydalı oldu mu?

Kaynaklar ve referanslar

#KaynakYayınTarihAna fikir
1Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack ↗Aleph Alpha29 Eyl 2026

1 kaynak

Son güncelleme:

Oossallms.txt.md

Paylaş

Oossa · Bülten

Yapay zekâda hafta, anlaşılır dille

Her pazartesi: bilmeye değer haberler, sade bir dille. Ücretsiz, spam yok.