Brève · 1 min de lecture
Comparaison des checkpoints de préentraînement avec une recette identique
Pour chacun des checkpoints, les trois étapes en aval (entraînement intermédiaire, adaptation au long contexte et SFT) suivent la même recette de taux d’apprentissage.
Oossa · À propos d’Oossa
La recette retenue
Nous avons testé les neuf combinaisons possibles de ( m, ℓ ) — où m et ℓ sont les facteurs de taux d’apprentissage de l’entraînement intermédiaire et de l’adaptation au long contexte, choisis dans {1, 1/3, 1/9} — tout en maintenant le facteur SFT fixe à s = 1/3. Ce test a été effectué sur le checkpoint **Cooldown**, et la combinaison ayant obtenu le meilleur score agrégé aux benchmarks après le SFT était **(1, 1)(1, 1)**.
Pourquoi utiliser la même recette pour tous les checkpoints
Les contraintes liées à l’infrastructure d’entraînement ne nous ayant pas permis d’ajuster un calendrier de taux d’apprentissage distinct pour chaque checkpoint de préentraînement, nous avons adopté la recette **(1, 1)(1, 1)** pour tous les checkpoints (Constant, Cooldown et Merge). Cela garantit une recette en aval *identique* et permet d’attribuer les écarts de score final au checkpoint de préentraînement lui-même, plutôt qu’à un calendrier de fine-tuning différent.
Pourquoi c'est important
L’utilisation de la même recette, la plus performante, pour tous les checkpoints rend la comparaison équitable : seule la qualité du checkpoint de préentraînement varie, et non le calendrier de taux d’apprentissage des étapes en aval.
Sources et références
| # | Source | Média | Date | À retenir |
|---|---|---|---|---|
| 1 | Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack ↗ | Aleph Alpha | 29 sept. 2026 |
1 sources
Dernière mise à jour:
Oossa · Newsletter
La semaine de l'IA, expliquée
Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.