Hanwen Li och kollegor publicerade den 8 oktober 2026 en artikel om VoS (Value of Steering). Metoden lär sig från en stor mängd kontrafaktiska körningar när i processen en agent baserad på en stor språkmodell bör korrigeras. VoS kan köras offline eller online och använder en gräns för tillåten skada för att undvika att störa körningar som redan lyckas. I 12 kombinationer av riktmärken och agenter höjde VoS poängen med i genomsnitt 7,8 poäng och slog fem befintliga osäkerhetsbaserade utlösare i 11 fall.
Varför det spelar roll
För utvecklare av AI-assistenter erbjuder VoS ett praktiskt sätt att ingripa bara när det sannolikt gör nytta och därmed öka tillförlitligheten utan omfattande manuell övervakning.