Onderzoekers van NVIDIA kondigden een nieuwe trainingsmethode aan: PivotOPD. Dit is een techniek voor on-policy distillatie — een manier om AI te trainen terwijl die interacties aangaat — die is ontwikkeld voor LLM-agenten die meerdere gespreksrondes voeren. De methode leert agenten belangrijke fouten vroeg in een dialoog te herkennen en ervan te herstellen. In tests behaalde PivotOPD de hoogste gemiddelde score van 13 concurrerende methoden op drie standaardbenchmarks voor agenten.
Waarom het ertoe doet
Dankzij beter herstel van fouten kunnen conversatie-AI-tools betrouwbaarder worden voor gebruikers die langere interacties met meerdere stappen nodig hebben.