Des chercheurs de NVIDIA ont annoncé une nouvelle méthode d’entraînement appelée PivotOPD. Il s’agit d’une technique de distillation on-policy — une façon d’entraîner une IA pendant qu’elle interagit — conçue pour les agents LLM capables de mener des conversations à plusieurs tours. Elle apprend aux agents à repérer les erreurs décisives dès le début d’un dialogue et à se corriger. Lors de tests, PivotOPD a obtenu le meilleur score moyen parmi 13 approches concurrentes, sur trois benchmarks courants pour les agents.
Pourquoi c'est important
Une meilleure capacité à corriger leurs erreurs pourrait rendre les outils d’IA conversationnelle plus fiables pour les utilisateurs qui ont besoin d’échanges longs comportant plusieurs étapes.