Investigadores de NVIDIA anunciaron un nuevo método de entrenamiento llamado PivotOPD. Es una técnica de destilación on-policy —una forma de enseñar a la IA mientras interactúa— diseñada para agentes basados en modelos de lenguaje grandes (LLM) que mantienen conversaciones de varios turnos. El método enseña a los agentes a detectar errores decisivos al principio del diálogo y a recuperarse de ellos. En las pruebas, PivotOPD obtuvo la puntuación media más alta entre 13 enfoques competidores en tres pruebas de referencia estándar para agentes.
Por qué importa
Una mejor capacidad para corregir errores podría hacer que las herramientas de IA conversacional sean más fiables para quienes necesitan interacciones más largas y con varios pasos.