# Confronto tra checkpoint di pre-training con ricetta abbinata

> Per ciascun checkpoint, tutte e tre le fasi successive (mid-training, adattamento al contesto lungo e SFT) vengono eseguite con la stessa ricetta di learning rate.

Oossa · 2026-09-29 · https://oossa.com/it/matched-recipe-comparison-of-pre-training-checkpoints

## Quale ricetta è stata scelta

Abbiamo testato le nove combinazioni possibili di ( m, ℓ ), dove m e ℓ sono i fattori del learning rate per il mid-training e l’adattamento al contesto lungo, scelti tra {1, 1/3, 1/9}, mantenendo fisso a s = 1/3 il fattore SFT.  Il test è stato eseguito sul checkpoint **Cooldown** e la combinazione che ha ottenuto il punteggio aggregato più alto sui benchmark dopo la SFT è stata **(1, 1)(1, 1)**.

## Perché si usa la stessa ricetta per tutti i checkpoint

Poiché i vincoli dell’infrastruttura di training non ci hanno permesso di ottimizzare una pianificazione del learning rate specifica per ciascun checkpoint di pre-training, abbiamo adottato la ricetta **(1, 1)(1, 1)** per tutti i checkpoint (Constant, Cooldown e Merge).  In questo modo la ricetta delle fasi successive è *abbinata* e le eventuali differenze nei punteggi finali possono essere attribuite al checkpoint di pre-training sottostante, anziché a una diversa pianificazione del fine-tuning.

## I fatti

- Fattore del mid-training m = 1
- Fattore per il contesto lungo ℓ = 1
- Fattore SFT s = 1/3
- Scelta perché ha ottenuto il punteggio aggregato più alto dopo la SFT sul checkpoint Cooldown.

## Perché conta

Usare un’unica ricetta, quella con le prestazioni migliori, per tutti i checkpoint rende il confronto equo: l’unica variabile è la qualità del checkpoint di pre-training, non la pianificazione del learning rate nelle fasi successive.

## Fonti e riferimenti

1. [Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack](https://www.aleph-alpha.com/en/blog/good-pretraining-bad-sft/) – Aleph Alpha, 2026-09-29

Ultimo aggiornamento: 2026-09-29
