Hanwen Li و همکارانش در ۸ اکتبر ۲۰۲۶ مقالهای درباره VoS (ارزش هدایت) منتشر کردند. این روش با یادگیری از مجموعه بزرگی از اجراهای خلافواقع، تعیین میکند عامل مبتنی بر مدل زبانی بزرگ (LLM) در کدام مرحله باید اصلاح شود. VoS را میتوان بهصورت آفلاین یا آنلاین اجرا کرد و برای جلوگیری از مداخله در اجراهای موفق، از محرکی مبتنی بر «بودجه آسیب» استفاده میکند. VoS در ۱۲ ترکیبِ معیار و عامل، امتیازها را بهطور میانگین ۷.۸ امتیاز افزایش داد و در ۱۱ مورد از پنج محرک موجودِ مبتنی بر عدمقطعیت بهتر عمل کرد.
چرا مهم است
برای توسعهدهندگان دستیارهای هوش مصنوعی، VoS راهی کاربردی فراهم میکند تا فقط زمانی مداخله کنند که احتمالاً مفید است؛ در نتیجه، قابلیت اطمینان بهبود مییابد، بیآنکه نظارت دستیِ بیشازحد لازم باشد.