NVIDIA 연구진이 PivotOPD라는 새로운 훈련법을 발표했다. 에이전트가 상호작용하는 과정에서 AI를 가르치는 온폴리시 증류 기법으로, 여러 차례 대화를 주고받는 LLM 에이전트를 위해 설계됐다. 이 방법은 대화 초기에 중요한 실수를 알아차리고 이를 만회하도록 에이전트를 훈련한다. 테스트에서 PivotOPD는 표준 에이전트 벤치마크 3종에 걸쳐 13개 경쟁 기법 중 평균 점수가 가장 높았다.
왜 중요한가
실수를 더 잘 만회하면 여러 단계로 이어지는 긴 상호작용이 필요한 사용자에게 대화형 AI 도구의 신뢰도를 높일 수 있다.