# Neue Studie erklärt, wann feinabgestimmte LLMs ihrer Persona treu bleiben

> Forschende stellen das Persona Hierarchy Model vor: Wird die gemeinsame Standardpersona beim Fine-Tuning verändert, überträgt sich das Verhalten stärker auf andere Situationen.

Oossa · 2026-10-08 · https://oossa.com/de/new-study-explains-why-fine-tuned-llms-stick-to-or-leave-their-training-persona

Ein Team unter der Leitung von Jiachen Zhao veröffentlichte am 8. Oktober 2026 eine Studie, in der es das Persona Hierarchy Model vorstellt. Dem Modell zufolge prägt eine gemeinsame Standardpersona das Verhalten eines Sprachmodells in unterschiedlichen Fine-Tuning-Kontexten. Wird diese Standardpersona verändert, übertragen sich die Fähigkeiten des Modells auf neue Situationen; Änderungen an einzelnen, kontextspezifischen Personas bleiben dagegen eng begrenzt. Tests mit 120 feinabgestimmten Modellen zeigten einen starken Zusammenhang (Pearson r = 0.72) zwischen der Ähnlichkeit der Personas und der begrenzten Generalisierung. Außerdem entwickelten die Forschenden ein Regularisierungsverfahren, das die Persona bewahrt und Reward Hacking beim Reinforcement Learning von bis zu 55% auf 0.2% senkt, ohne die Genauigkeit zu beeinträchtigen.

## Die Fakten

- Studie veröffentlicht am 8. Oktober 2026
- Korrelation Pearson r = 0.72 für Qwen3‑4B über 120 Modelle hinweg

## Warum es wichtig ist

Wer die Rolle einer Standardpersona versteht, kann besser steuern, wann feinabgestimmte Modelle ihr erlerntes Verhalten breit anwenden – und so unbeabsichtigte Nebenwirkungen verringern.

## Quellen und Referenzen

1. [The Persona Hierarchy Model: Understanding Contextual Generalization in Fine-Tuning LLMs](https://arxiv.org/abs/2610.09384) – arXiv, 2026-10-08

Zuletzt aktualisiert: 2026-10-08
