OossaAI ontwikkelt zich snel. Wij leggen het eenvoudig uit.
Nieuwsbrief

Kort bericht · 1 min lezen

Vergelijking van pre-trainingscheckpoints met een identiek trainingsrecept

Voor elk checkpoint worden dezelfde leerpercentages gebruikt in alle drie de vervolgfasen (mid-training, aanpassing aan lange contexten en SFT).

Oossa · Over Oossa

Welk recept is gekozen

We hebben de negen mogelijke combinaties van ( m, ℓ ) getest. Daarbij zijn m en ℓ de leerfactoren voor mid-training en lange contexten, gekozen uit {1, 1/3, 1/9}; de SFT-factor bleef vast op s = 1/3. De test werd uitgevoerd op het **Cooldown**-checkpoint. De combinatie met de hoogste totale benchmarkscore na SFT was **(1, 1)(1, 1)**.

Waarom voor alle checkpoints hetzelfde recept wordt gebruikt

Omdat de beperkingen van de trainingsinfrastructuur het onmogelijk maakten om voor elk pre-trainingscheckpoint een afzonderlijk leerschema af te stemmen, hebben we voor elk checkpoint (Constant, Cooldown en Merge) het recept **(1, 1)(1, 1)** gebruikt. Zo blijft het vervolgtraject *identiek*, waardoor verschillen in de eindscore kunnen worden toegeschreven aan het onderliggende pre-trainingscheckpoint en niet aan een ander finetuningsschema.

Waarom het ertoe doet

Door voor alle checkpoints hetzelfde, best presterende recept te gebruiken, is de vergelijking eerlijk: alleen de kwaliteit van het pre-trainingscheckpoint verschilt, niet het leerschema voor de vervolgstappen.

Was dit artikel nuttig?

Bronnen en referenties

1 bronnen

Laatst bijgewerkt:

Oossallms.txt.md

Delen

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.