Hanwen Li und seine Kollegen veröffentlichten am 8. Okt. 2026 eine Arbeit zu VoS (Value of Steering). Das Verfahren wertet eine umfangreiche Tabelle mit kontrafaktischen Durchläufen aus, um zu bestimmen, an welchem Schritt ein auf einem großen Sprachmodell basierender Agent korrigiert werden sollte. VoS kann offline oder online eingesetzt werden und nutzt eine Auslöseschwelle auf Basis eines Schadensbudgets, damit erfolgreiche Durchläufe nicht unnötig gestört werden. Bei 12 Kombinationen aus Benchmarks und Agenten steigerte VoS die Ergebnisse im Schnitt um 7,8 Punkte und übertraf in 11 Fällen fünf bestehende, auf Unsicherheit basierende Auslöser.
Warum es wichtig ist
Für Entwickler von KI-Assistenten bietet VoS eine praktische Möglichkeit, nur dann einzugreifen, wenn dies wahrscheinlich hilft. So lässt sich die Zuverlässigkeit verbessern, ohne übermäßig viel manuell überwachen zu müssen.