Breve · 1 min de lectura
Comparación de checkpoints de preentrenamiento con una receta común
Las tres etapas posteriores (entrenamiento intermedio, adaptación a contextos largos y SFT) se ejecutan con la misma receta de tasa de aprendizaje para cada checkpoint.
Oossa · Acerca de Oossa
Qué receta se eligió
Probamos las nueve combinaciones posibles de ( m, ℓ ), donde m y ℓ son los factores de tasa de aprendizaje para el entrenamiento intermedio y la adaptación a contextos largos, respectivamente, tomados del conjunto {1, 1/3, 1/9}; el factor de SFT se mantuvo fijo en s = 1/3. La prueba se realizó con el checkpoint **Cooldown**, y la combinación que obtuvo la puntuación agregada más alta en los benchmarks después de SFT fue **(1, 1)(1, 1)**.
Por qué se usa la misma receta para todos los checkpoints
Como las limitaciones de la infraestructura de entrenamiento nos impidieron ajustar un programa de tasas de aprendizaje distinto para cada checkpoint de preentrenamiento, adoptamos la receta **(1, 1)(1, 1)** para todos los checkpoints (Constant, Cooldown y Merge). Esto garantiza que se use una receta posterior *común*, de modo que las diferencias en las puntuaciones finales puedan atribuirse al checkpoint de preentrenamiento subyacente y no a un programa de ajuste fino diferente.
Por qué importa
Usar una única receta, la de mejor rendimiento, para todos los checkpoints hace que la comparación sea justa: la única variable es la calidad del propio checkpoint de preentrenamiento, no el programa de tasas de aprendizaje de las etapas posteriores.
Fuentes y referencias
| # | Fuente | Medio | Fecha | Idea clave |
|---|---|---|---|---|
| 1 | Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack ↗ | Aleph Alpha | 29 sept 2026 |
1 fuentes
Última actualización:
Oossa · Boletín
La semana en IA, explicada
Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.