Jiachen Zhao氏が率いるチームは2026年10月8日、「ペルソナ階層モデル」を提案する論文を発表した。このモデルによると、共有のデフォルト・ペルソナが、さまざまな微調整の状況で言語モデルの振る舞いを左右する。デフォルト・ペルソナを変えると、モデルの能力は新たな状況にも広がる一方、個別のペルソナだけを調整した場合、その影響は限定的にとどまる。微調整済みモデル120個を使った検証では、ペルソナの類似度と汎化の限定性に強い相関(Pearson r = 0.72)が見られた。また、ペルソナを維持する正則化手法も導入。強化学習における報酬ハッキングを最大55%から0.2%に抑え、精度も維持した。
なぜ重要か
デフォルト・ペルソナの役割を理解すれば、微調整したモデルが学習した振る舞いをどこまで広く適用するかを開発者が制御しやすくなり、意図しない副作用を減らせる。