# Vergelijking van pre-trainingscheckpoints met een identiek trainingsrecept

> Voor elk checkpoint worden dezelfde leerpercentages gebruikt in alle drie de vervolgfasen (mid-training, aanpassing aan lange contexten en SFT).

Oossa · 2026-09-29 · https://oossa.com/nl/matched-recipe-comparison-of-pre-training-checkpoints

## Welk recept is gekozen

We hebben de negen mogelijke combinaties van ( m, ℓ ) getest. Daarbij zijn m en ℓ de leerfactoren voor mid-training en lange contexten, gekozen uit {1, 1/3, 1/9}; de SFT-factor bleef vast op s = 1/3.  De test werd uitgevoerd op het **Cooldown**-checkpoint. De combinatie met de hoogste totale benchmarkscore na SFT was **(1, 1)(1, 1)**.

## Waarom voor alle checkpoints hetzelfde recept wordt gebruikt

Omdat de beperkingen van de trainingsinfrastructuur het onmogelijk maakten om voor elk pre-trainingscheckpoint een afzonderlijk leerschema af te stemmen, hebben we voor elk checkpoint (Constant, Cooldown en Merge) het recept **(1, 1)(1, 1)** gebruikt.  Zo blijft het vervolgtraject *identiek*, waardoor verschillen in de eindscore kunnen worden toegeschreven aan het onderliggende pre-trainingscheckpoint en niet aan een ander finetuningsschema.

## De feiten

- Mid-training-factor m = 1
- Factor voor lange contexten ℓ = 1
- SFT-factor s = 1/3
- Gekozen omdat dit recept de hoogste totale score na SFT opleverde op het Cooldown-checkpoint.

## Waarom het ertoe doet

Door voor alle checkpoints hetzelfde, best presterende recept te gebruiken, is de vergelijking eerlijk: alleen de kwaliteit van het pre-trainingscheckpoint verschilt, niet het leerschema voor de vervolgstappen.

## Bronnen en referenties

1. [Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack](https://www.aleph-alpha.com/en/blog/good-pretraining-bad-sft/) – Aleph Alpha, 2026-09-29

Laatst bijgewerkt: 2026-09-29
