# Nieuwe methode stuurt AI-agenten bij op basis van geleerde interventiewaarde

> Onderzoekers introduceren VoS, een monitor die voorspelt wanneer bijsturen van een taalmodelagent helpt. Dat levert gemiddeld zo’n 8 punten winst op.

Oossa · 2026-10-08 · https://oossa.com/nl/new-method-lets-ai-agents-be-steered-using-learned-value-of-intervention

Hanwen Li en collega’s publiceerden op 8 oktober 2026 een artikel over VoS (Value of Steering). De methode leert van een grote tabel met contrafeitelijke runs om te bepalen op welk moment een agent op basis van een LLM moet worden bijgestuurd. VoS werkt offline of online en gebruikt een trigger op basis van een schadekrediet om succesvolle runs niet te verstoren. In 12 combinaties van benchmarks en agenten verhoogde VoS de scores gemiddeld met 7,8 punten. Ook presteerde de methode in 11 gevallen beter dan vijf bestaande triggers op basis van onzekerheid.

## De feiten

- VoS verbetert de gemiddelde prestaties met 7,8 punten ten opzichte van uitvoering zonder aanpassingen.
- In het onderzoek werden 1.864 trajecten en ongeveer 82.000 contrafeitelijke vervolgtrajecten geëvalueerd.

## Waarom het ertoe doet

Voor ontwikkelaars van AI-assistenten biedt VoS een praktische manier om alleen bij te sturen wanneer dat waarschijnlijk helpt. Zo wordt de betrouwbaarheid groter zonder dat er voortdurend handmatig toezicht nodig is.

## Bronnen en referenties

1. [From Uncertainty to Action: Learning to Steer LLM Agents](https://arxiv.org/abs/2610.09115) – arXiv, 2026-10-08
2. [When the Governor Becomes the Disturbance: Control-Generated Disturbance and Cost-Aware Backoff in Governed Tool-Using Agents](https://arxiv.org/abs/2610.09037) – arXiv cs.MA, 2026-10-08

Laatst bijgewerkt: 2026-10-08
