Oossa

Neue Studie erklärt, wann feinabgestimmte LLMs ihrer Persona treu bleiben

Forschende stellen das Persona Hierarchy Model vor: Wird die gemeinsame Standardpersona beim Fine-Tuning verändert, überträgt sich das Verhalten stärker auf andere Situationen.

KurzmeldungVon Von Oossa veröffentlicht: 1 Min. Lesezeit

Ein Team unter der Leitung von Jiachen Zhao veröffentlichte am 8. Oktober 2026 eine Studie, in der es das Persona Hierarchy Model vorstellt. Dem Modell zufolge prägt eine gemeinsame Standardpersona das Verhalten eines Sprachmodells in unterschiedlichen Fine-Tuning-Kontexten. Wird diese Standardpersona verändert, übertragen sich die Fähigkeiten des Modells auf neue Situationen; Änderungen an einzelnen, kontextspezifischen Personas bleiben dagegen eng begrenzt. Tests mit 120 feinabgestimmten Modellen zeigten einen starken Zusammenhang (Pearson r = 0.72) zwischen der Ähnlichkeit der Personas und der begrenzten Generalisierung. Außerdem entwickelten die Forschenden ein Regularisierungsverfahren, das die Persona bewahrt und Reward Hacking beim Reinforcement Learning von bis zu 55% auf 0.2% senkt, ohne die Genauigkeit zu beeinträchtigen.

Warum es wichtig ist

Wer die Rolle einer Standardpersona versteht, kann besser steuern, wann feinabgestimmte Modelle ihr erlerntes Verhalten breit anwenden – und so unbeabsichtigte Nebenwirkungen verringern.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.