# Comparaison des checkpoints de préentraînement avec une recette identique

> Pour chacun des checkpoints, les trois étapes en aval (entraînement intermédiaire, adaptation au long contexte et SFT) suivent la même recette de taux d’apprentissage.

Oossa · 2026-09-29 · https://oossa.com/fr/matched-recipe-comparison-of-pre-training-checkpoints

## La recette retenue

Nous avons testé les neuf combinaisons possibles de ( m, ℓ ) — où m et ℓ sont les facteurs de taux d’apprentissage de l’entraînement intermédiaire et de l’adaptation au long contexte, choisis dans {1, 1/3, 1/9} — tout en maintenant le facteur SFT fixe à s = 1/3.  Ce test a été effectué sur le checkpoint **Cooldown**, et la combinaison ayant obtenu le meilleur score agrégé aux benchmarks après le SFT était **(1, 1)(1, 1)**.

## Pourquoi utiliser la même recette pour tous les checkpoints

Les contraintes liées à l’infrastructure d’entraînement ne nous ayant pas permis d’ajuster un calendrier de taux d’apprentissage distinct pour chaque checkpoint de préentraînement, nous avons adopté la recette **(1, 1)(1, 1)** pour tous les checkpoints (Constant, Cooldown et Merge).  Cela garantit une recette en aval *identique* et permet d’attribuer les écarts de score final au checkpoint de préentraînement lui-même, plutôt qu’à un calendrier de fine-tuning différent.

## Les faits

- Facteur d’entraînement intermédiaire m = 1
- Facteur de long contexte ℓ = 1
- Facteur SFT s = 1/3
- Choisie parce qu’elle a donné le meilleur score agrégé après SFT sur le checkpoint Cooldown.

## Pourquoi c'est important

L’utilisation de la même recette, la plus performante, pour tous les checkpoints rend la comparaison équitable : seule la qualité du checkpoint de préentraînement varie, et non le calendrier de taux d’apprentissage des étapes en aval.

## Sources et références

1. [Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack](https://www.aleph-alpha.com/en/blog/good-pretraining-bad-sft/) – Aleph Alpha, 2026-09-29

Dernière mise à jour: 2026-09-29
