# Jämförelse av förträningscheckpoints med samma recept

> Alla tre steg efter förträningen (mellanförträning, anpassning till långa kontexter och SFT) körs med samma inlärningsrecept för varje checkpoint.

Oossa · 2026-09-29 · https://oossa.com/sv/matched-recipe-comparison-of-pre-training-checkpoints

## Vilket recept valdes?

Vi testade de nio möjliga kombinationerna av ( m, ℓ ), där m och ℓ är faktorerna för inlärningshastigheten vid mellanförträning respektive anpassning till långa kontexter, hämtade från {1, 1/3, 1/9} – samtidigt som SFT-faktorn hölls fast vid s = 1/3.  Testerna gjordes på checkpointen **Cooldown**, och den kombination som gav högst sammanlagt benchmarkresultat efter SFT var **(1, 1)(1, 1)**.

## Varför används samma recept för alla checkpoints?

Begränsningar i träningsinfrastrukturen gjorde att vi inte kunde finjustera ett separat inlärningsschema för varje förträningscheckpoint. Därför använde vi receptet **(1, 1)(1, 1)** för samtliga checkpoints (Constant, Cooldown och Merge).  Det ger samma recept för stegen efter förträningen, så att eventuella skillnader i slutresultaten kan tillskrivas själva förträningscheckpointen och inte ett annat finjusteringsschema.

## Fakta

- Faktor för mellanförträning m = 1
- Faktor för långa kontexter ℓ = 1
- SFT-faktor s = 1/3
- Valdes eftersom det gav högst sammanlagt resultat efter SFT på checkpointen Cooldown.

## Varför det spelar roll

När samma, bäst presterande recept används för alla checkpoints blir jämförelsen rättvis: den enda variabeln är kvaliteten på själva förträningscheckpointen, inte inlärningsschemat för stegen efter förträningen.

## Källor och referenser

1. [Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack](https://www.aleph-alpha.com/en/blog/good-pretraining-bad-sft/) – Aleph Alpha, 2026-09-29

Senast uppdaterad: 2026-09-29
