Oossa

सीखकर तय करने वाला तरीका बताएगा AI एजेंट को कब सुधारें

शोधकर्ताओं ने VoS पेश किया है—यह मॉनिटर अनुमान लगाता है कि भाषा-मॉडल एजेंट को कब सुधारने से फायदा होगा। इससे प्रदर्शन में करीब 8 अंक की बढ़ोतरी हुई।

संक्षिप्तलेखक: Oossa द्वारा प्रकाशित: अंतिम अपडेट: 1 मिनट पढ़ना

Hanwen Li और उनके सहकर्मियों ने 8 Oct 2026 को VoS (Value of Steering) पर एक शोधपत्र जारी किया। यह काउंटरफैक्चुअल रन के एक बड़े डेटासेट से सीखता है कि LLM-आधारित एजेंट को किस चरण पर सुधारना चाहिए। VoS ऑफलाइन या ऑनलाइन चल सकता है और सफल रन में बेवजह दखल से बचने के लिए harm-budget ट्रिगर का इस्तेमाल करता है। 12 बेंचमार्क-एजेंट संयोजनों में VoS ने स्कोर औसतन 7.8 अंक बढ़ाए और अनिश्चितता पर आधारित पांच मौजूदा ट्रिगरों को 11 मामलों में पीछे छोड़ा।

यह क्यों मायने रखता है

AI असिस्टेंट बनाने वालों के लिए VoS दखल का एक व्यावहारिक तरीका देता है: यह केवल तभी हस्तक्षेप करता है जब उससे फायदा होने की संभावना हो, जिससे लगातार मानवीय निगरानी के बिना विश्वसनीयता बढ़ती है।

क्या यह लेख उपयोगी था?
साझा करें

यह भी पढ़ें

Oossa · न्यूज़लेटर

AI का हफ़्ता, आसान भाषा में

हर सोमवार: जानने लायक खबरें, सरल भाषा में। मुफ़्त, कोई स्पैम नहीं।