Исследователи NVIDIA объявили о новом методе обучения PivotOPD. Это метод дистилляции на собственных данных — способ обучать ИИ в процессе взаимодействия, — разработанный для ИИ-агентов, ведущих диалоги из нескольких ходов. Метод учит агентов замечать ключевые ошибки на раннем этапе диалога и исправлять их. В испытаниях PivotOPD показал самый высокий средний результат среди 13 конкурирующих подходов на трёх стандартных тестах для агентов.
Почему это важно
Умение лучше исправлять ошибки может повысить надёжность разговорных ИИ-инструментов для пользователей, которым нужны длительные взаимодействия из нескольких последовательных шагов.