Oossa

Nieuw onderzoek verklaart waarom LLM’s hun trainingspersona behouden of loslaten

Onderzoekers introduceren het Persona Hierarchy Model. Aanpassing van een gedeelde standaardpersona tijdens fine-tuning leidt volgens hen tot bredere overdracht van gedrag.

Kort berichtDoor Gepubliceerd door Oossa: 1 min lezen

Een team onder leiding van Jiachen Zhao publiceerde op 8 oktober 2026 een paper waarin het Persona Hierarchy Model wordt geïntroduceerd. Volgens dit model bepaalt een gedeelde standaardpersona mede hoe een taalmodel zich gedraagt in verschillende fine-tuningcontexten. Verandering van die standaardpersona zorgt ervoor dat vaardigheden van het model ook in nieuwe situaties tot uiting komen, terwijl aanpassingen aan alleen lokale persona’s een beperkt effect hebben. Tests met 120 gefinetunede modellen lieten een sterk verband zien (Pearson r = 0,72) tussen de overeenkomst van persona’s en beperkte generalisatie. De onderzoekers voegden ook een regularisatiemethode toe die de persona behoudt. Die vermindert reward hacking bij reinforcement learning van maximaal 55% tot 0,2%, zonder dat de nauwkeurigheid afneemt.

Waarom het ertoe doet

Inzicht in de rol van een standaardpersona helpt ontwikkelaars te bepalen wanneer gefinetunede modellen aangeleerd gedrag breed toepassen, en zo onbedoelde neveneffecten te beperken.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.