# सीखकर तय करने वाला तरीका बताएगा AI एजेंट को कब सुधारें

> शोधकर्ताओं ने VoS पेश किया है—यह मॉनिटर अनुमान लगाता है कि भाषा-मॉडल एजेंट को कब सुधारने से फायदा होगा। इससे प्रदर्शन में करीब 8 अंक की बढ़ोतरी हुई।

Oossa · 2026-10-08 · https://oossa.com/hi/new-method-lets-ai-agents-be-steered-using-learned-value-of-intervention

Hanwen Li और उनके सहकर्मियों ने 8 Oct 2026 को VoS (Value of Steering) पर एक शोधपत्र जारी किया। यह काउंटरफैक्चुअल रन के एक बड़े डेटासेट से सीखता है कि LLM-आधारित एजेंट को किस चरण पर सुधारना चाहिए। VoS ऑफलाइन या ऑनलाइन चल सकता है और सफल रन में बेवजह दखल से बचने के लिए harm-budget ट्रिगर का इस्तेमाल करता है। 12 बेंचमार्क-एजेंट संयोजनों में VoS ने स्कोर औसतन 7.8 अंक बढ़ाए और अनिश्चितता पर आधारित पांच मौजूदा ट्रिगरों को 11 मामलों में पीछे छोड़ा।

## तथ्य

- VoS ने बिना बदलाव वाले निष्पादन की तुलना में औसत प्रदर्शन 7.8 अंक बेहतर किया।
- अध्ययन में 1,864 ट्रैजेक्टरी और करीब 82,000 काउंटरफैक्चुअल कंटिन्यूएशन का मूल्यांकन किया गया।

## यह क्यों मायने रखता है

AI असिस्टेंट बनाने वालों के लिए VoS दखल का एक व्यावहारिक तरीका देता है: यह केवल तभी हस्तक्षेप करता है जब उससे फायदा होने की संभावना हो, जिससे लगातार मानवीय निगरानी के बिना विश्वसनीयता बढ़ती है।

## स्रोत और संदर्भ

1. [From Uncertainty to Action: Learning to Steer LLM Agents](https://arxiv.org/abs/2610.09115) – arXiv, 2026-10-08
2. [When the Governor Becomes the Disturbance: Control-Generated Disturbance and Cost-Aware Backoff in Governed Tool-Using Agents](https://arxiv.org/abs/2610.09037) – arXiv cs.MA, 2026-10-08

अंतिम अपडेट: 2026-10-08
