Notis · 1 min läsning
Jämförelse av förträningscheckpoints med samma recept
Alla tre steg efter förträningen (mellanförträning, anpassning till långa kontexter och SFT) körs med samma inlärningsrecept för varje checkpoint.
Oossa · Om Oossa
Vilket recept valdes?
Vi testade de nio möjliga kombinationerna av ( m, ℓ ), där m och ℓ är faktorerna för inlärningshastigheten vid mellanförträning respektive anpassning till långa kontexter, hämtade från {1, 1/3, 1/9} – samtidigt som SFT-faktorn hölls fast vid s = 1/3. Testerna gjordes på checkpointen **Cooldown**, och den kombination som gav högst sammanlagt benchmarkresultat efter SFT var **(1, 1)(1, 1)**.
Varför används samma recept för alla checkpoints?
Begränsningar i träningsinfrastrukturen gjorde att vi inte kunde finjustera ett separat inlärningsschema för varje förträningscheckpoint. Därför använde vi receptet **(1, 1)(1, 1)** för samtliga checkpoints (Constant, Cooldown och Merge). Det ger samma recept för stegen efter förträningen, så att eventuella skillnader i slutresultaten kan tillskrivas själva förträningscheckpointen och inte ett annat finjusteringsschema.
Varför det spelar roll
När samma, bäst presterande recept används för alla checkpoints blir jämförelsen rättvis: den enda variabeln är kvaliteten på själva förträningscheckpointen, inte inlärningsschemat för stegen efter förträningen.
Källor och referenser
| # | Källa | Utgivare | Datum | Kärnpunkt |
|---|---|---|---|---|
| 1 | Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack ↗ | Aleph Alpha | 29 sep. 2026 |
1 källor
Senast uppdaterad:
Oossa · Nyhetsbrev
Veckans AI, förklarad
Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.