Sakana AI publicerade en artikel i Transactions on Machine Learning Research (TMLR) där företaget beskriver ett nytt system för sakkunniggranskning av stora språkmodeller. Systemet använder tre Claude-baserade agenter som samarbetar för att hitta fel i forskningspåståenden. I ett test med 1,164 kända motsägelser flaggade systemet 73.43% av felen i centrala påståenden. Det tidigare bästa systemet upptäckte bara 14.81% av samma fel.
Så gick testet till
Testet, som kallas Contradiction Benchmark, innehåller 1,164 fall där en artikels huvudtes motsäger de belägg som presenteras i samma artikel. Sakana AI testade sina Multi-Layered Review-agenter (MLR) mot testet och noterade hur många fel varje system upptäckte. De redovisade siffrorna kommer från Sakana AIs egen utvärdering.
Varför det spelar roll
Om verktyg för sakkunniggranskning kan hitta de flesta felaktiga påståenden kan forskare få snabbare återkoppling före publicering. För läsarna kan det innebära färre artiklar med dolda motsägelser. Resultaten behöver fortfarande verifieras oberoende.