NVIDIA-forskare presenterade en ny träningsmetod som kallas PivotOPD. Det är en metod för destillering med on-policy-inlärning – ett sätt att träna AI medan den interagerar – som är utformad för LLM-agenter i dialoger med flera turer. Metoden lär agenter att upptäcka avgörande misstag tidigt i en dialog och återhämta sig från dem. I tester fick PivotOPD det högsta genomsnittliga resultatet av 13 konkurrerande metoder i tre etablerade benchmarktester för agenter.
Varför det spelar roll
Bättre förmåga att rätta till misstag kan göra konversationsbaserade AI-verktyg mer tillförlitliga för användare som behöver längre interaktioner i flera steg.