NVIDIAの研究者らは、新たな学習手法「PivotOPD」を発表した。これは、AIが実際にやり取りしながら学ぶ方法であるオンポリシー蒸留技術で、複数ターンにわたるLLMエージェント向けに設計されている。対話の早い段階で重要なミスを見つけ、そこから立て直す方法をエージェントに学習させる。テストでは、標準的なエージェント向けベンチマーク3種類で、競合する13の手法の中で平均スコアが最も高かった。
なぜ重要か
ミスからの立て直しがうまくなれば、複数の段階を踏む長いやり取りを必要とするユーザーにとって、会話型AIツールの信頼性向上につながる可能性がある。