OossaLa IA avanza rápido. Te lo explicamos de forma sencilla.
Boletín

Breve · 1 min de lectura

Comparación de checkpoints de preentrenamiento con una receta común

Las tres etapas posteriores (entrenamiento intermedio, adaptación a contextos largos y SFT) se ejecutan con la misma receta de tasa de aprendizaje para cada checkpoint.

Oossa · Acerca de Oossa

Qué receta se eligió

Probamos las nueve combinaciones posibles de ( m, ℓ ), donde m y ℓ son los factores de tasa de aprendizaje para el entrenamiento intermedio y la adaptación a contextos largos, respectivamente, tomados del conjunto {1, 1/3, 1/9}; el factor de SFT se mantuvo fijo en s = 1/3. La prueba se realizó con el checkpoint **Cooldown**, y la combinación que obtuvo la puntuación agregada más alta en los benchmarks después de SFT fue **(1, 1)(1, 1)**.

Por qué se usa la misma receta para todos los checkpoints

Como las limitaciones de la infraestructura de entrenamiento nos impidieron ajustar un programa de tasas de aprendizaje distinto para cada checkpoint de preentrenamiento, adoptamos la receta **(1, 1)(1, 1)** para todos los checkpoints (Constant, Cooldown y Merge). Esto garantiza que se use una receta posterior *común*, de modo que las diferencias en las puntuaciones finales puedan atribuirse al checkpoint de preentrenamiento subyacente y no a un programa de ajuste fino diferente.

Por qué importa

Usar una única receta, la de mejor rendimiento, para todos los checkpoints hace que la comparación sea justa: la única variable es la calidad del propio checkpoint de preentrenamiento, no el programa de tasas de aprendizaje de las etapas posteriores.

¿Te resultó útil este artículo?

Fuentes y referencias

#FuenteMedioFechaIdea clave
1Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack ↗Aleph Alpha29 sept 2026

1 fuentes

Última actualización:

Oossallms.txt.md

Compartir

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.