Kurzmeldung · 1 Min. Lesezeit
Vergleich von Pre-Training-Checkpoints mit identischem Fine-Tuning-Rezept
Für alle drei nachgelagerten Trainingsphasen (Mid-Training, Long-Context-Anpassung und SFT) wird bei jedem Checkpoint dasselbe Lernraten-Rezept verwendet.
Oossa · Über Oossa
Welches Rezept gewählt wurde
Wir haben die neun möglichen Kombinationen von ( m, ℓ ) durchprobiert – dabei stehen m und ℓ für die Lernratenfaktoren beim Mid-Training und bei der Long-Context-Anpassung aus der Menge {1, 1/3, 1/9} –, während der SFT-Faktor fest auf s = 1/3 gesetzt blieb. Der Versuch wurde mit dem **Cooldown**-Checkpoint durchgeführt. Die Kombination mit dem höchsten aggregierten Benchmark-Ergebnis nach dem SFT war **(1, 1)(1, 1)**.
Warum dasselbe Rezept für alle Checkpoints verwendet wird
Da die Einschränkungen der Trainingsinfrastruktur es uns nicht ermöglichten, für jeden Pre-Training-Checkpoint einen eigenen Lernratenplan abzustimmen, verwendeten wir für alle Checkpoints (Constant, Cooldown und Merge) das Rezept **(1, 1)(1, 1)**. So kommt für alle dasselbe *nachgelagerte* Rezept zum Einsatz. Unterschiede bei den Endergebnissen lassen sich dadurch dem jeweiligen Pre-Training-Checkpoint zuschreiben und nicht einem unterschiedlichen Fine-Tuning-Plan.
Warum es wichtig ist
Ein einziges, besonders leistungsstarkes Rezept für alle Checkpoints sorgt für einen fairen Vergleich: Die einzige veränderliche Größe ist die Qualität des Pre-Training-Checkpoints selbst, nicht der nachgelagerte Lernratenplan.
Quellen und Referenzen
| # | Quelle | Medium | Datum | Kernaussage |
|---|---|---|---|---|
| 1 | Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack ↗ | Aleph Alpha | 29.09.2026 |
1 Quellen
Zuletzt aktualisiert:
Oossa · Newsletter
Die KI-Woche, erklärt
Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.