Hanwen Li e seus colegas divulgaram um artigo em 8 de outubro de 2026 sobre o VoS (Value of Steering). O método aprende com uma ampla tabela de execuções contrafactuais para determinar em que etapa um agente baseado em LLM deve ser corrigido. O VoS pode funcionar offline ou online e usa um mecanismo de limite de dano para evitar interferir em execuções bem-sucedidas. Em 12 combinações de benchmarks e agentes, o VoS elevou as pontuações em uma média de 7,8 pontos e superou cinco mecanismos existentes baseados em incerteza em 11 casos.
Por que importa
Para quem desenvolve assistentes de IA, o VoS oferece uma forma prática de intervir apenas quando há boas chances de ajudar, aumentando a confiabilidade sem exigir supervisão manual excessiva.