Jiachen Zhao领衔的团队于2026年10月8日发表论文,提出“人设层级模型”。该模型认为,共享的默认人设会影响语言模型在不同微调场景中的行为。改变默认人设,会让模型的能力迁移到新的情境;如果只调整局部人设,影响范围则较窄。对120个微调模型进行的测试显示,人设相似度与泛化受限之间存在显著关联(Pearson r = 0.72)。研究团队还提出一种保留人设的正则化方法,可将强化学习中的奖励作弊率从最高55%降至0.2%,同时不损失准确率。
为什么重要
了解默认人设的作用,有助于开发者控制微调模型在多大范围内应用所学行为,减少意外副作用。