# 事前学習チェックポイントのレシピをそろえた比較

> 各チェックポイントについて、下流の3段階（中間学習、長文コンテキストへの適応、SFT）には同じ学習率レシピを適用する。

Oossa · 2026-09-29 · https://oossa.com/ja/matched-recipe-comparison-of-pre-training-checkpoints

## 採用したレシピ

SFTの係数を s = 1/3 に固定し、中間学習と長文コンテキスト学習の学習率係数 m と ℓ をそれぞれ {1, 1/3, 1/9} から選ぶ9通りの組み合わせを試した。この検証は**Cooldown**チェックポイントで行い、SFT後のベンチマーク総合スコアが最も高かった組み合わせは **(1, 1)(1, 1)** だった。

## すべてのチェックポイントで同じレシピを使う理由

学習インフラ上の制約により、事前学習チェックポイントごとに別々の学習率スケジュールを調整できなかったため、すべてのチェックポイント（Constant、Cooldown、Merge）に **(1, 1)(1, 1)** のレシピを適用した。これにより、下流工程のレシピをそろえた比較が可能になり、最終スコアの差を異なる微調整スケジュールではなく、事前学習チェックポイントそのものの違いに帰属させられる。

## 事実

- 中間学習係数 m = 1
- 長文コンテキスト係数 ℓ = 1
- SFT係数 s = 1/3
- CooldownチェックポイントでSFT後の総合スコアが最も高かったため採用。

## なぜ重要か

すべてのチェックポイントに最も高い性能を示した単一のレシピを適用することで、公平な比較ができる。変数となるのは事前学習チェックポイント自体の品質だけで、下流工程の学習率スケジュールではない。

## 出典と参考資料

1. [Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack](https://www.aleph-alpha.com/en/blog/good-pretraining-bad-sft/) – Aleph Alpha, 2026-09-29

最終更新: 2026-09-29
