OossaA IA evolui rápido. Nós explicamos de forma simples.
Newsletter

Nota · 1 min de leitura

Comparação de checkpoints de pré-treinamento com a mesma receita

As três etapas posteriores (treinamento intermediário, adaptação a contextos longos e SFT) usam a mesma receita de taxa de aprendizado para cada checkpoint.

Oossa · Sobre a Oossa

Qual receita foi escolhida

Testamos as nove combinações possíveis de ( m, ℓ ) — em que m e ℓ são os fatores da taxa de aprendizado para o treinamento intermediário e a adaptação a contextos longos, escolhidos entre {1, 1/3, 1/9} — mantendo fixo em s = 1/3 o fator de SFT. O teste foi feito no checkpoint **Cooldown**, e a combinação que obteve a maior pontuação agregada nos benchmarks após o SFT foi **(1, 1)(1, 1)**.

Por que a mesma receita é usada para todos os checkpoints

Como as restrições da infraestrutura de treinamento impediram que ajustássemos uma programação de taxa de aprendizado específica para cada checkpoint de pré-treinamento, adotamos a receita **(1, 1)(1, 1)** para todos os checkpoints (Constant, Cooldown e Merge). Isso garante que a receita usada nas etapas posteriores seja *a mesma* para todos, de modo que quaisquer diferenças nas pontuações finais possam ser atribuídas ao checkpoint de pré-treinamento subjacente, e não a uma programação de ajuste fino diferente.

Por que importa

Usar uma única receita, com o melhor desempenho, para todos os checkpoints torna a comparação justa: a única variável é a qualidade do próprio checkpoint de pré-treinamento, não a programação da taxa de aprendizado nas etapas posteriores.

Este artigo foi útil?

Fontes e referências

#FonteVeículoDataPonto principal
1Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack ↗Aleph Alpha29 de set. de 2026

1 fontes

Última atualização:

Oossallms.txt.md

Compartilhar

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.