Hanwen Li et ses collègues ont publié le 8 octobre 2026 un article présentant VoS (Value of Steering, ou valeur du pilotage). À partir d’un vaste ensemble de simulations contrefactuelles, le système apprend à quel moment corriger un agent fondé sur un grand modèle de langage (LLM). VoS peut fonctionner hors ligne ou en ligne et s’appuie sur un seuil de risque pour éviter d’interrompre les exécutions qui se déroulent bien. Sur 12 combinaisons de bancs d’essai et d’agents, VoS a amélioré les scores de 7,8 points en moyenne et a surpassé cinq mécanismes de déclenchement fondés sur l’incertitude dans 11 cas.
Pourquoi c'est important
Pour les développeurs d’assistants IA, VoS offre un moyen concret d’intervenir uniquement lorsque cela a des chances d’aider, afin d’améliorer la fiabilité sans surveillance manuelle excessive.