OossaKI entwickelt sich schnell. Wir erklären es einfach.
Newsletter

Kurzmeldung · 1 Min. Lesezeit

Vergleich von Pre-Training-Checkpoints mit identischem Fine-Tuning-Rezept

Für alle drei nachgelagerten Trainingsphasen (Mid-Training, Long-Context-Anpassung und SFT) wird bei jedem Checkpoint dasselbe Lernraten-Rezept verwendet.

Oossa · Über Oossa

Welches Rezept gewählt wurde

Wir haben die neun möglichen Kombinationen von ( m, ℓ ) durchprobiert – dabei stehen m und ℓ für die Lernratenfaktoren beim Mid-Training und bei der Long-Context-Anpassung aus der Menge {1, 1/3, 1/9} –, während der SFT-Faktor fest auf s = 1/3 gesetzt blieb. Der Versuch wurde mit dem **Cooldown**-Checkpoint durchgeführt. Die Kombination mit dem höchsten aggregierten Benchmark-Ergebnis nach dem SFT war **(1, 1)(1, 1)**.

Warum dasselbe Rezept für alle Checkpoints verwendet wird

Da die Einschränkungen der Trainingsinfrastruktur es uns nicht ermöglichten, für jeden Pre-Training-Checkpoint einen eigenen Lernratenplan abzustimmen, verwendeten wir für alle Checkpoints (Constant, Cooldown und Merge) das Rezept **(1, 1)(1, 1)**. So kommt für alle dasselbe *nachgelagerte* Rezept zum Einsatz. Unterschiede bei den Endergebnissen lassen sich dadurch dem jeweiligen Pre-Training-Checkpoint zuschreiben und nicht einem unterschiedlichen Fine-Tuning-Plan.

Warum es wichtig ist

Ein einziges, besonders leistungsstarkes Rezept für alle Checkpoints sorgt für einen fairen Vergleich: Die einzige veränderliche Größe ist die Qualität des Pre-Training-Checkpoints selbst, nicht der nachgelagerte Lernratenplan.

War dieser Artikel hilfreich?

Quellen und Referenzen

#QuelleMediumDatumKernaussage
1Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack ↗Aleph Alpha29.09.2026

1 Quellen

Zuletzt aktualisiert:

Oossallms.txt.md

Teilen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.