Hanwen Li ve çalışma arkadaşları, bir büyük dil modeli (LLM) tabanlı ajanın hangi adımda düzeltilmesi gerektiğini belirlemek için karşıolgusal çalıştırmalardan oluşan geniş bir tablodan öğrenen VoS’yi (Yönlendirmenin Değeri) tanıtan makalelerini 8 Ekim 2026’da yayımladı. VoS çevrimdışı ya da çevrimiçi çalışabiliyor ve başarılı çalıştırmaları bölmemek için bir zarar bütçesi tetikleyicisi kullanıyor. VoS, 12 kıyaslama testi-ajans kombinasyonunda puanları ortalama 7,8 puan yükseltti ve 11 durumda belirsizlik temelli mevcut beş tetikleyiciyi geride bıraktı.
Neden önemli
Yapay zekâ asistanı geliştiricileri için VoS, aşırı manuel denetime gerek kalmadan güvenilirliği artırmak üzere yalnızca yarar sağlama olasılığı yüksek olduğunda müdahale etmenin pratik bir yolunu sunuyor.