# 预训练检查点的匹配配方对比

> 对每个检查点，三个下游阶段（中期训练、长上下文适配和 SFT）均采用相同的学习率配方。

Oossa · 2026-09-29 · https://oossa.com/zh/matched-recipe-comparison-of-pre-training-checkpoints

## 采用了什么配方

我们遍历了九种可能的 ( m, ℓ ) 组合，其中 m 和 ℓ 分别是中期训练和长上下文阶段的学习率因子，取值均为 {1, 1/3, 1/9}；同时将 SFT 因子固定为 s = 1/3。我们在 **Cooldown** 检查点上进行了这项测试，结果显示，SFT 后综合基准测试得分最高的组合是 **(1, 1)(1, 1)**。

## 为什么所有检查点都采用相同配方

由于训练基础设施方面的限制，我们无法针对每个预训练检查点分别调整学习率计划，因此所有检查点（Constant、Cooldown 和 Merge）均采用 **(1, 1)(1, 1)** 配方。这样可以确保下游配方保持*一致*，最终得分的任何差异都能归因于预训练检查点本身，而非微调计划不同。

## 事实

- 中期训练因子 m = 1
- 长上下文因子 ℓ = 1
- SFT 因子 s = 1/3
- 之所以选用该配方，是因为它在 Cooldown 检查点上取得了最高的 SFT 后综合得分。

## 为什么重要

在所有检查点上采用同一套表现最佳的配方，能让比较更加公平：唯一的变量是预训练检查点本身的质量，而不是下游学习率计划。

## 来源与参考

1. [Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack](https://www.aleph-alpha.com/en/blog/good-pretraining-bad-sft/) – Aleph Alpha, 2026-09-29

最后更新: 2026-09-29
