OossaAI utvecklas fort. Vi förklarar det enkelt.
Nyhetsbrev

Notis · 1 min läsning

Jämförelse av förträningscheckpoints med samma recept

Alla tre steg efter förträningen (mellanförträning, anpassning till långa kontexter och SFT) körs med samma inlärningsrecept för varje checkpoint.

Oossa · Om Oossa

Vilket recept valdes?

Vi testade de nio möjliga kombinationerna av ( m, ℓ ), där m och ℓ är faktorerna för inlärningshastigheten vid mellanförträning respektive anpassning till långa kontexter, hämtade från {1, 1/3, 1/9} – samtidigt som SFT-faktorn hölls fast vid s = 1/3. Testerna gjordes på checkpointen **Cooldown**, och den kombination som gav högst sammanlagt benchmarkresultat efter SFT var **(1, 1)(1, 1)**.

Varför används samma recept för alla checkpoints?

Begränsningar i träningsinfrastrukturen gjorde att vi inte kunde finjustera ett separat inlärningsschema för varje förträningscheckpoint. Därför använde vi receptet **(1, 1)(1, 1)** för samtliga checkpoints (Constant, Cooldown och Merge). Det ger samma recept för stegen efter förträningen, så att eventuella skillnader i slutresultaten kan tillskrivas själva förträningscheckpointen och inte ett annat finjusteringsschema.

Varför det spelar roll

När samma, bäst presterande recept används för alla checkpoints blir jämförelsen rättvis: den enda variabeln är kvaliteten på själva förträningscheckpointen, inte inlärningsschemat för stegen efter förträningen.

Var den här artikeln användbar?

Källor och referenser

#KällaUtgivareDatumKärnpunkt
1Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack ↗Aleph Alpha29 sep. 2026

1 källor

Senast uppdaterad:

Oossallms.txt.md

Dela

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.