Команда под руководством Jiachen Zhao опубликовала 8 октября 2026 года работу, в которой представила модель иерархии персон. Согласно ей, общая персона по умолчанию влияет на поведение языковой модели в разных сценариях дообучения. Если изменить эту персону, навыки модели переносятся на новые ситуации, а изменения только локальных персон дают более узкий эффект. Проверка на 120 дообученных моделях показала сильную связь (коэффициент Пирсона r = 0.72) между сходством персон и ограниченной способностью к обобщению. Авторы также разработали метод регуляризации, сохраняющий персону: он снижает долю случаев взлома системы вознаграждений при обучении с подкреплением с 55% до 0.2% без потери точности.
Почему это важно
Понимание роли персоны по умолчанию помогает разработчикам контролировать, насколько широко дообученные модели применяют усвоенное поведение, и снижать риск непредвиденных побочных эффектов.