# Ön eğitim kontrol noktalarının eşleştirilmiş reçeteyle karşılaştırılması

> Her kontrol noktası için üç aşağı akış aşamasında da (ara eğitim, uzun bağlam uyarlaması ve SFT) aynı öğrenme oranı reçetesi uygulanıyor.

Oossa · 2026-09-29 · https://oossa.com/tr/matched-recipe-comparison-of-pre-training-checkpoints

## Hangi reçete seçildi?

SFT çarpanını s = 1/3’te sabit tutarak, ara eğitim ve uzun bağlam öğrenme oranı çarpanları olan m ve ℓ’nin {1, 1/3, 1/9} kümesinden alındığı dokuz olası (m, ℓ) kombinasyonunu taradık. Tarama **Cooldown** kontrol noktasında yapıldı ve SFT sonrası toplam kıyaslama puanını en yükseğe çıkaran kombinasyon **(1, 1)(1, 1)** oldu.

## Aynı reçete neden tüm kontrol noktalarında kullanılıyor?

Eğitim altyapısındaki kısıtlamalar, her bir ön eğitim kontrol noktası için ayrı bir öğrenme oranı çizelgesini ayarlamamıza engel olduğundan, tüm kontrol noktalarında (Constant, Cooldown ve Merge) **(1, 1)(1, 1)** reçetesini kullandık. Böylece aşağı akış reçetesi *eşleştirilmiş* oluyor ve nihai puanlardaki farklılıklar farklı bir ince ayar çizelgesine değil, temel ön eğitim kontrol noktasına bağlanabiliyor.

## Gerçekler

- Ara eğitim çarpanı m = 1
- Uzun bağlam çarpanı ℓ = 1
- SFT çarpanı s = 1/3
- Cooldown kontrol noktasında SFT sonrası toplam puanı en yükseğe çıkardığı için seçildi.

## Neden önemli

Tüm kontrol noktalarında tek ve en iyi performansı gösteren reçeteyi kullanmak karşılaştırmayı adil kılıyor: değişen tek unsur, aşağı akış öğrenme oranı çizelgesi değil, ön eğitim kontrol noktasının kalitesi oluyor.

## Kaynaklar ve referanslar

1. [Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack](https://www.aleph-alpha.com/en/blog/good-pretraining-bad-sft/) – Aleph Alpha, 2026-09-29

Son güncelleme: 2026-09-29
