Hanwen Li 等人于 2026 年 10 月 8 日发表论文,介绍了 VoS(Value of Steering)。该方法从大量反事实运行数据中学习,判断应在哪个步骤纠正基于大语言模型的智能体。VoS 可离线或在线运行,并通过伤害预算触发机制,避免干扰原本成功的运行。在 12 种基准测试与智能体组合中,VoS 的得分平均提高 7.8 分;在 11 种组合中,它的表现优于五种现有的基于不确定性的触发机制。
为什么重要
对 AI 助手开发者而言,VoS 提供了一种实用方法,只在干预可能有所帮助时才出手,从而提升可靠性,同时避免过多人工监督。