Ein Team unter der Leitung von Jiachen Zhao veröffentlichte am 8. Oktober 2026 eine Studie, in der es das Persona Hierarchy Model vorstellt. Dem Modell zufolge prägt eine gemeinsame Standardpersona das Verhalten eines Sprachmodells in unterschiedlichen Fine-Tuning-Kontexten. Wird diese Standardpersona verändert, übertragen sich die Fähigkeiten des Modells auf neue Situationen; Änderungen an einzelnen, kontextspezifischen Personas bleiben dagegen eng begrenzt. Tests mit 120 feinabgestimmten Modellen zeigten einen starken Zusammenhang (Pearson r = 0.72) zwischen der Ähnlichkeit der Personas und der begrenzten Generalisierung. Außerdem entwickelten die Forschenden ein Regularisierungsverfahren, das die Persona bewahrt und Reward Hacking beim Reinforcement Learning von bis zu 55% auf 0.2% senkt, ohne die Genauigkeit zu beeinträchtigen.
Warum es wichtig ist
Wer die Rolle einer Standardpersona versteht, kann besser steuern, wann feinabgestimmte Modelle ihr erlerntes Verhalten breit anwenden – und so unbeabsichtigte Nebenwirkungen verringern.