Breve · 1 min di lettura
Confronto tra checkpoint di pre-training con ricetta abbinata
Per ciascun checkpoint, tutte e tre le fasi successive (mid-training, adattamento al contesto lungo e SFT) vengono eseguite con la stessa ricetta di learning rate.
Oossa · Chi è Oossa
Quale ricetta è stata scelta
Abbiamo testato le nove combinazioni possibili di ( m, ℓ ), dove m e ℓ sono i fattori del learning rate per il mid-training e l’adattamento al contesto lungo, scelti tra {1, 1/3, 1/9}, mantenendo fisso a s = 1/3 il fattore SFT. Il test è stato eseguito sul checkpoint **Cooldown** e la combinazione che ha ottenuto il punteggio aggregato più alto sui benchmark dopo la SFT è stata **(1, 1)(1, 1)**.
Perché si usa la stessa ricetta per tutti i checkpoint
Poiché i vincoli dell’infrastruttura di training non ci hanno permesso di ottimizzare una pianificazione del learning rate specifica per ciascun checkpoint di pre-training, abbiamo adottato la ricetta **(1, 1)(1, 1)** per tutti i checkpoint (Constant, Cooldown e Merge). In questo modo la ricetta delle fasi successive è *abbinata* e le eventuali differenze nei punteggi finali possono essere attribuite al checkpoint di pre-training sottostante, anziché a una diversa pianificazione del fine-tuning.
Perché conta
Usare un’unica ricetta, quella con le prestazioni migliori, per tutti i checkpoint rende il confronto equo: l’unica variabile è la qualità del checkpoint di pre-training, non la pianificazione del learning rate nelle fasi successive.
Fonti e riferimenti
| # | Fonte | Testata | Data | Punto chiave |
|---|---|---|---|---|
| 1 | Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack ↗ | Aleph Alpha | 29 set 2026 |
1 fonti
Ultimo aggiornamento:
Oossa · Newsletter
La settimana dell'IA, spiegata
Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.