Forschende von NVIDIA haben ein neues Trainingsverfahren namens PivotOPD vorgestellt. Die On-Policy-Destillation – eine Methode, KI während der Interaktion zu trainieren – wurde für LLM-Agenten entwickelt, die mehrere Gesprächsrunden führen. Das Verfahren bringt den Agenten bei, entscheidende Fehler früh im Dialog zu erkennen und sich davon zu erholen. In Tests erzielte PivotOPD den höchsten Durchschnittswert unter 13 konkurrierenden Ansätzen bei drei etablierten Agenten-Benchmarks.
Warum es wichtig ist
Wenn KI Fehler besser korrigieren kann, werden dialogbasierte Tools möglicherweise zuverlässiger – besonders für Nutzer, die längere, mehrstufige Interaktionen benötigen.