短信 · 1 分で読める
事前学習チェックポイントのレシピをそろえた比較
各チェックポイントについて、下流の3段階(中間学習、長文コンテキストへの適応、SFT)には同じ学習率レシピを適用する。
Oossa · Oossaについて
採用したレシピ
SFTの係数を s = 1/3 に固定し、中間学習と長文コンテキスト学習の学習率係数 m と ℓ をそれぞれ {1, 1/3, 1/9} から選ぶ9通りの組み合わせを試した。この検証は**Cooldown**チェックポイントで行い、SFT後のベンチマーク総合スコアが最も高かった組み合わせは **(1, 1)(1, 1)** だった。
すべてのチェックポイントで同じレシピを使う理由
学習インフラ上の制約により、事前学習チェックポイントごとに別々の学習率スケジュールを調整できなかったため、すべてのチェックポイント(Constant、Cooldown、Merge)に **(1, 1)(1, 1)** のレシピを適用した。これにより、下流工程のレシピをそろえた比較が可能になり、最終スコアの差を異なる微調整スケジュールではなく、事前学習チェックポイントそのものの違いに帰属させられる。
なぜ重要か
すべてのチェックポイントに最も高い性能を示した単一のレシピを適用することで、公平な比較ができる。変数となるのは事前学習チェックポイント自体の品質だけで、下流工程の学習率スケジュールではない。
この記事は役に立ちましたか?
出典と参考資料
| # | 出典 | 媒体 | 日付 | 要点 |
|---|---|---|---|---|
| 1 | Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack ↗ | Aleph Alpha | 2026/09/29 |
1 件の出典
最終更新:
Oossa · ニュースレター
今週のAIを、わかりやすく
毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。