Kort bericht · 1 min lezen
Vergelijking van pre-trainingscheckpoints met een identiek trainingsrecept
Voor elk checkpoint worden dezelfde leerpercentages gebruikt in alle drie de vervolgfasen (mid-training, aanpassing aan lange contexten en SFT).
Oossa · Over Oossa
Welk recept is gekozen
We hebben de negen mogelijke combinaties van ( m, ℓ ) getest. Daarbij zijn m en ℓ de leerfactoren voor mid-training en lange contexten, gekozen uit {1, 1/3, 1/9}; de SFT-factor bleef vast op s = 1/3. De test werd uitgevoerd op het **Cooldown**-checkpoint. De combinatie met de hoogste totale benchmarkscore na SFT was **(1, 1)(1, 1)**.
Waarom voor alle checkpoints hetzelfde recept wordt gebruikt
Omdat de beperkingen van de trainingsinfrastructuur het onmogelijk maakten om voor elk pre-trainingscheckpoint een afzonderlijk leerschema af te stemmen, hebben we voor elk checkpoint (Constant, Cooldown en Merge) het recept **(1, 1)(1, 1)** gebruikt. Zo blijft het vervolgtraject *identiek*, waardoor verschillen in de eindscore kunnen worden toegeschreven aan het onderliggende pre-trainingscheckpoint en niet aan een ander finetuningsschema.
Waarom het ertoe doet
Door voor alle checkpoints hetzelfde, best presterende recept te gebruiken, is de vergelijking eerlijk: alleen de kwaliteit van het pre-trainingscheckpoint verschilt, niet het leerschema voor de vervolgstappen.
Bronnen en referenties
| # | Bron | Medium | Datum | Kernpunt |
|---|---|---|---|---|
| 1 | Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack ↗ | Aleph Alpha | 29 sep 2026 |
1 bronnen
Laatst bijgewerkt:
Oossa · Nieuwsbrief
De AI-week, uitgelegd
Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.