Un gruppo guidato da Jiachen Zhao ha pubblicato uno studio l’8 ottobre 2026, presentando il Persona Hierarchy Model. Secondo il modello, una persona predefinita condivisa influenza il comportamento di un modello linguistico nei diversi contesti di fine-tuning. Modificare questa persona predefinita fa sì che le capacità del modello si trasferiscano a nuove situazioni, mentre gli interventi limitati alle singole persone producono effetti circoscritti. I test su 120 modelli sottoposti a fine-tuning hanno mostrato una forte correlazione (Pearson r = 0.72) tra la somiglianza delle persone e la limitata capacità di generalizzazione. I ricercatori hanno inoltre introdotto un metodo di regolarizzazione che preserva la persona e riduce il reward hacking nell’apprendimento per rinforzo, portandolo da un massimo del 55% allo 0.2% senza perdita di accuratezza.
Perché conta
Capire il ruolo di una persona predefinita aiuta gli sviluppatori a controllare quando i modelli sottoposti a fine-tuning applicano su ampia scala i comportamenti appresi, riducendo gli effetti collaterali indesiderati.