# روش تازه‌ای برای هدایت عامل‌های هوش مصنوعی با سنجش اثر مداخله

> پژوهشگران VoS را معرفی کرده‌اند؛ سامانه‌ای که پیش‌بینی می‌کند اصلاح یک عامل مبتنی بر مدل زبانی چه زمانی مفید است و عملکرد را حدود ۸ امتیاز بهبود می‌دهد.

Oossa · 2026-10-08 · https://oossa.com/fa/new-method-lets-ai-agents-be-steered-using-learned-value-of-intervention

Hanwen Li و همکارانش در ۸ اکتبر ۲۰۲۶ مقاله‌ای درباره VoS (ارزش هدایت) منتشر کردند. این روش با یادگیری از مجموعه بزرگی از اجراهای خلاف‌واقع، تعیین می‌کند عامل مبتنی بر مدل زبانی بزرگ (LLM) در کدام مرحله باید اصلاح شود. VoS را می‌توان به‌صورت آفلاین یا آنلاین اجرا کرد و برای جلوگیری از مداخله در اجراهای موفق، از محرکی مبتنی بر «بودجه آسیب» استفاده می‌کند. VoS در ۱۲ ترکیبِ معیار و عامل، امتیازها را به‌طور میانگین ۷.۸ امتیاز افزایش داد و در ۱۱ مورد از پنج محرک موجودِ مبتنی بر عدم‌قطعیت بهتر عمل کرد.

## حقایق

- VoS در مقایسه با اجرای بدون تغییر، عملکرد را به‌طور میانگین ۷.۸ امتیاز بهبود می‌دهد.
- این پژوهش ۱٬۸۶۴ مسیر اجرا و حدود ۸۲٬۰۰۰ ادامه خلاف‌واقع را ارزیابی کرد.

## چرا مهم است

برای توسعه‌دهندگان دستیارهای هوش مصنوعی، VoS راهی کاربردی فراهم می‌کند تا فقط زمانی مداخله کنند که احتمالاً مفید است؛ در نتیجه، قابلیت اطمینان بهبود می‌یابد، بی‌آنکه نظارت دستیِ بیش‌ازحد لازم باشد.

## منابع و ارجاع‌ها

1. [From Uncertainty to Action: Learning to Steer LLM Agents](https://arxiv.org/abs/2610.09115) – arXiv, 2026-10-08
2. [When the Governor Becomes the Disturbance: Control-Generated Disturbance and Cost-Aware Backoff in Governed Tool-Using Agents](https://arxiv.org/abs/2610.09037) – arXiv cs.MA, 2026-10-08

آخرین به‌روزرسانی: 2026-10-08
