Oossa

Sakanas AI-granskare hittar 73 % av felaktiga påståenden i test

Företagets nya granskare med tre Claude-baserade agenter hittade 73.43% av felen i centrala påståenden, långt fler än det tidigare bästa resultatet på 14.81%.

Av Publicerad av Oossa: 1 min läsning

Andreea Avramescu · Unsplash

Sakana AI publicerade en artikel i Transactions on Machine Learning Research (TMLR) där företaget beskriver ett nytt system för sakkunniggranskning av stora språkmodeller. Systemet använder tre Claude-baserade agenter som samarbetar för att hitta fel i forskningspåståenden. I ett test med 1,164 kända motsägelser flaggade systemet 73.43% av felen i centrala påståenden. Det tidigare bästa systemet upptäckte bara 14.81% av samma fel.

Så gick testet till

Testet, som kallas Contradiction Benchmark, innehåller 1,164 fall där en artikels huvudtes motsäger de belägg som presenteras i samma artikel. Sakana AI testade sina Multi-Layered Review-agenter (MLR) mot testet och noterade hur många fel varje system upptäckte. De redovisade siffrorna kommer från Sakana AIs egen utvärdering.

Varför det spelar roll

Om verktyg för sakkunniggranskning kan hitta de flesta felaktiga påståenden kan forskare få snabbare återkoppling före publicering. För läsarna kan det innebära färre artiklar med dolda motsägelser. Resultaten behöver fortfarande verifieras oberoende.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.