NVIDIA araştırmacıları, PivotOPD adını verdikleri yeni bir eğitim yöntemini duyurdu. Çok turlu büyük dil modeli (LLM) ajanları için geliştirilen bu yöntem, etkileşim sırasında yapay zekâyı eğitmenin bir yolu olan politika içi damıtma tekniğini kullanıyor. Ajanlara, diyalogdaki kritik hataları erkenden fark edip bunları telafi etmeyi öğretiyor. Testlerde PivotOPD, üç standart ajan kıyaslamasında 13 rakip yaklaşım arasında en yüksek ortalama puanı aldı.
Neden önemli
Hataları daha iyi telafi edebilen sohbet tabanlı yapay zekâ araçları, uzun ve birden fazla adım içeren etkileşimlere ihtiyaç duyan kullanıcılar için daha güvenilir olabilir.