Oossa

Geometrisk metod förbättrar språkmodellers svarspoäng

En ny metod hittar en riktning i modellernas dolda tillstånd som rankar svar upp till 52 poäng bättre än vanlig sannolikhetspoängsättning.

Av Publicerad av Oossa: 1 min läsning

Domenico Loia · Unsplash

Forskare har upptäckt att stora språkmodeller lagrar en geometrisk signal för om ett svar är rätt. Genom att undersöka den genomsnittliga förskjutningen i dolda tillstånd mellan felaktiga och korrekta svar kan de skapa en poängvektor som rangordnar svarsalternativ utan någon finjustering. I tester med fem modeller på mellan 1 miljard och 8 miljarder parametrar slog metoden den vanliga nollskottsmetoden med log-sannolikheter med upp till 32 poäng på ARC‑Challenge och MMLU och upp till 52 poäng på TruthfulQA.

Så fungerar metoden

Forskarna tar femtio märkta exempel, kör dem genom modellen för att samla in dolda representationer ungefär halvvägs genom nätverket och beräknar medelvektorn som pekar från tillstånd för felaktiga svar till tillstånd för korrekta svar. När modellen sedan ska användas behöver varje svarsalternativ bara en framåtpassering och en enda skalärprodukt med den här vektorn. Ingen svarstext genereras och inga modellparametrar ändras.

Vad det innebär för modellernas tillförlitlighet

När den geometriska riktningen används för att upptäcka hallucinationer når den ett AUROC-värde på 0.693, jämfört med 0.578 för vanlig sannolikhetspoängsättning. Studien visar också att signaler om korrekthet inom faktabaserat resonemang, ämneskunskap och sanningsenlighet ligger i nästan ortogonala delrum. Det innebär att modellerna behåller separata signaler för olika slags korrekthet. Det kan förklara varför modeller ofta verkar känna till rätt svar internt men ändå misslyckas med att ge det.

Varför det spelar roll

För användare i vardagen kan metoden bidra till att chattbottar ger mer tillförlitliga svar, särskilt på faktabaserade frågor. Den pekar också på ett sätt att upptäcka sannolika hallucinationer utan omfattande beräkningar. Metoden kräver dock fortfarande tillgång till modellernas dolda tillstånd, som de flesta offentliga API:er inte visar.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.