Nota · 1 min de leitura
Comparação de checkpoints de pré-treinamento com a mesma receita
As três etapas posteriores (treinamento intermediário, adaptação a contextos longos e SFT) usam a mesma receita de taxa de aprendizado para cada checkpoint.
Oossa · Sobre a Oossa
Qual receita foi escolhida
Testamos as nove combinações possíveis de ( m, ℓ ) — em que m e ℓ são os fatores da taxa de aprendizado para o treinamento intermediário e a adaptação a contextos longos, escolhidos entre {1, 1/3, 1/9} — mantendo fixo em s = 1/3 o fator de SFT. O teste foi feito no checkpoint **Cooldown**, e a combinação que obteve a maior pontuação agregada nos benchmarks após o SFT foi **(1, 1)(1, 1)**.
Por que a mesma receita é usada para todos os checkpoints
Como as restrições da infraestrutura de treinamento impediram que ajustássemos uma programação de taxa de aprendizado específica para cada checkpoint de pré-treinamento, adotamos a receita **(1, 1)(1, 1)** para todos os checkpoints (Constant, Cooldown e Merge). Isso garante que a receita usada nas etapas posteriores seja *a mesma* para todos, de modo que quaisquer diferenças nas pontuações finais possam ser atribuídas ao checkpoint de pré-treinamento subjacente, e não a uma programação de ajuste fino diferente.
Por que importa
Usar uma única receita, com o melhor desempenho, para todos os checkpoints torna a comparação justa: a única variável é a qualidade do próprio checkpoint de pré-treinamento, não a programação da taxa de aprendizado nas etapas posteriores.
Fontes e referências
| # | Fonte | Veículo | Data | Ponto principal |
|---|---|---|---|---|
| 1 | Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack ↗ | Aleph Alpha | 29 de set. de 2026 |
1 fontes
Última atualização:
Oossa · Newsletter
A semana em IA, explicada
Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.