Hanwen Li en collega’s publiceerden op 8 oktober 2026 een artikel over VoS (Value of Steering). De methode leert van een grote tabel met contrafeitelijke runs om te bepalen op welk moment een agent op basis van een LLM moet worden bijgestuurd. VoS werkt offline of online en gebruikt een trigger op basis van een schadekrediet om succesvolle runs niet te verstoren. In 12 combinaties van benchmarks en agenten verhoogde VoS de scores gemiddeld met 7,8 punten. Ook presteerde de methode in 11 gevallen beter dan vijf bestaande triggers op basis van onzekerheid.
Waarom het ertoe doet
Voor ontwikkelaars van AI-assistenten biedt VoS een praktische manier om alleen bij te sturen wanneer dat waarschijnlijk helpt. Zo wordt de betrouwbaarheid groter zonder dat er voortdurend handmatig toezicht nodig is.