简讯 · 1 分钟阅读
预训练检查点的匹配配方对比
对每个检查点,三个下游阶段(中期训练、长上下文适配和 SFT)均采用相同的学习率配方。
Oossa · 关于 Oossa
采用了什么配方
我们遍历了九种可能的 ( m, ℓ ) 组合,其中 m 和 ℓ 分别是中期训练和长上下文阶段的学习率因子,取值均为 {1, 1/3, 1/9};同时将 SFT 因子固定为 s = 1/3。我们在 **Cooldown** 检查点上进行了这项测试,结果显示,SFT 后综合基准测试得分最高的组合是 **(1, 1)(1, 1)**。
为什么所有检查点都采用相同配方
由于训练基础设施方面的限制,我们无法针对每个预训练检查点分别调整学习率计划,因此所有检查点(Constant、Cooldown 和 Merge)均采用 **(1, 1)(1, 1)** 配方。这样可以确保下游配方保持*一致*,最终得分的任何差异都能归因于预训练检查点本身,而非微调计划不同。
为什么重要
在所有检查点上采用同一套表现最佳的配方,能让比较更加公平:唯一的变量是预训练检查点本身的质量,而不是下游学习率计划。
这篇文章有帮助吗?
来源与参考
| # | 来源 | 发布方 | 日期 | 要点 |
|---|---|---|---|---|
| 1 | Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack ↗ | Aleph Alpha | 2026年9月29日 |
1 个来源
最后更新:
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。