# 新研究揭示微调后的大语言模型为何沿用或偏离训练人设

> 研究人员提出“人设层级模型”：微调时修改共享的默认人设，会让模型行为迁移到更广泛的场景。

Oossa · 2026-10-08 · https://oossa.com/zh/new-study-explains-why-fine-tuned-llms-stick-to-or-leave-their-training-persona

Jiachen Zhao领衔的团队于2026年10月8日发表论文，提出“人设层级模型”。该模型认为，共享的默认人设会影响语言模型在不同微调场景中的行为。改变默认人设，会让模型的能力迁移到新的情境；如果只调整局部人设，影响范围则较窄。对120个微调模型进行的测试显示，人设相似度与泛化受限之间存在显著关联（Pearson r = 0.72）。研究团队还提出一种保留人设的正则化方法，可将强化学习中的奖励作弊率从最高55%降至0.2%，同时不损失准确率。

## 事实

- 论文发表于2026年10月8日
- 在120个Qwen3‑4B模型中，相关系数为Pearson r = 0.72

## 为什么重要

了解默认人设的作用，有助于开发者控制微调模型在多大范围内应用所学行为，减少意外副作用。

## 来源与参考

1. [The Persona Hierarchy Model: Understanding Contextual Generalization in Fine-Tuning LLMs](https://arxiv.org/abs/2610.09384) – arXiv, 2026-10-08

最后更新: 2026-10-08
