Pesquisadores da NVIDIA anunciaram um novo método de treinamento chamado PivotOPD. É uma técnica de destilação on-policy — uma forma de ensinar a IA enquanto ela interage — desenvolvida para agentes baseados em grandes modelos de linguagem que conduzem diálogos com várias interações. O método ensina os agentes a identificar erros decisivos no início de uma conversa e se recuperar deles. Nos testes, o PivotOPD obteve a maior pontuação média entre 13 abordagens concorrentes em três benchmarks padrão para agentes.
Por que importa
Uma melhor capacidade de corrigir erros pode tornar as ferramentas de IA conversacional mais confiáveis para quem precisa de interações mais longas e com várias etapas.