Een team onder leiding van Jiachen Zhao publiceerde op 8 oktober 2026 een paper waarin het Persona Hierarchy Model wordt geïntroduceerd. Volgens dit model bepaalt een gedeelde standaardpersona mede hoe een taalmodel zich gedraagt in verschillende fine-tuningcontexten. Verandering van die standaardpersona zorgt ervoor dat vaardigheden van het model ook in nieuwe situaties tot uiting komen, terwijl aanpassingen aan alleen lokale persona’s een beperkt effect hebben. Tests met 120 gefinetunede modellen lieten een sterk verband zien (Pearson r = 0,72) tussen de overeenkomst van persona’s en beperkte generalisatie. De onderzoekers voegden ook een regularisatiemethode toe die de persona behoudt. Die vermindert reward hacking bij reinforcement learning van maximaal 55% tot 0,2%, zonder dat de nauwkeurigheid afneemt.
Waarom het ertoe doet
Inzicht in de rol van een standaardpersona helpt ontwikkelaars te bepalen wanneer gefinetunede modellen aangeleerd gedrag breed toepassen, en zo onbedoelde neveneffecten te beperken.