I ricercatori di NVIDIA hanno annunciato un nuovo metodo di addestramento chiamato PivotOPD. È una tecnica di distillazione on-policy — un modo per insegnare all’IA mentre interagisce — pensata per gli agenti LLM multi-turno. Il metodo insegna agli agenti a individuare gli errori decisivi nelle prime fasi di un dialogo e a rimediare. Nei test, PivotOPD ha ottenuto il punteggio medio più alto tra 13 approcci concorrenti, su tre benchmark standard per agenti.
Perché conta
Una maggiore capacità di correggere gli errori potrebbe rendere gli strumenti di IA conversazionale più affidabili per chi deve affrontare interazioni lunghe e articolate in più passaggi.