# Comparação de checkpoints de pré-treinamento com a mesma receita

> As três etapas posteriores (treinamento intermediário, adaptação a contextos longos e SFT) usam a mesma receita de taxa de aprendizado para cada checkpoint.

Oossa · 2026-09-29 · https://oossa.com/pt/matched-recipe-comparison-of-pre-training-checkpoints

## Qual receita foi escolhida

Testamos as nove combinações possíveis de ( m, ℓ ) — em que m e ℓ são os fatores da taxa de aprendizado para o treinamento intermediário e a adaptação a contextos longos, escolhidos entre {1, 1/3, 1/9} — mantendo fixo em s = 1/3 o fator de SFT.  O teste foi feito no checkpoint **Cooldown**, e a combinação que obteve a maior pontuação agregada nos benchmarks após o SFT foi **(1, 1)(1, 1)**.

## Por que a mesma receita é usada para todos os checkpoints

Como as restrições da infraestrutura de treinamento impediram que ajustássemos uma programação de taxa de aprendizado específica para cada checkpoint de pré-treinamento, adotamos a receita **(1, 1)(1, 1)** para todos os checkpoints (Constant, Cooldown e Merge).  Isso garante que a receita usada nas etapas posteriores seja *a mesma* para todos, de modo que quaisquer diferenças nas pontuações finais possam ser atribuídas ao checkpoint de pré-treinamento subjacente, e não a uma programação de ajuste fino diferente.

## Os fatos

- Fator de treinamento intermediário m = 1
- Fator de adaptação a contextos longos ℓ = 1
- Fator de SFT s = 1/3
- Escolhida por ter alcançado a maior pontuação agregada após o SFT no checkpoint Cooldown.

## Por que importa

Usar uma única receita, com o melhor desempenho, para todos os checkpoints torna a comparação justa: a única variável é a qualidade do próprio checkpoint de pré-treinamento, não a programação da taxa de aprendizado nas etapas posteriores.

## Fontes e referências

1. [Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack](https://www.aleph-alpha.com/en/blog/good-pretraining-bad-sft/) – Aleph Alpha, 2026-09-29

Última atualização: 2026-09-29
