Oossa

新研究揭示微调后的大语言模型为何沿用或偏离训练人设

研究人员提出“人设层级模型”:微调时修改共享的默认人设,会让模型行为迁移到更广泛的场景。

简讯作者: Oossa 发布日期: 1 分钟阅读

Jiachen Zhao领衔的团队于2026年10月8日发表论文,提出“人设层级模型”。该模型认为,共享的默认人设会影响语言模型在不同微调场景中的行为。改变默认人设,会让模型的能力迁移到新的情境;如果只调整局部人设,影响范围则较窄。对120个微调模型进行的测试显示,人设相似度与泛化受限之间存在显著关联(Pearson r = 0.72)。研究团队还提出一种保留人设的正则化方法,可将强化学习中的奖励作弊率从最高55%降至0.2%,同时不损失准确率。

为什么重要

了解默认人设的作用,有助于开发者控制微调模型在多大范围内应用所学行为,减少意外副作用。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。