Oossa

Sakana AI’s review-AI ontdekt 73% van claimfouten

De nieuwe reviewer van het bedrijf, met drie op Claude gebaseerde agents, vond 73,43% van de fouten in hoofdclaims. Het vorige beste resultaat was 14,81%.

Door Gepubliceerd door Oossa: 1 min lezen

Andreea Avramescu · Unsplash

Sakana AI heeft in Transactions on Machine Learning Research (TMLR) een paper gepubliceerd over een nieuw peerreviewsysteem voor grote taalmodellen. Het systeem gebruikt drie op Claude gebaseerde agents die samenwerken om fouten in onderzoeksclaims op te sporen. In een benchmark met 1.164 bekende tegenstrijdigheden signaleerde het systeem 73,43% van de fouten in hoofdclaims. Het beste eerdere systeem ontdekte slechts 14,81% van dezelfde fouten.

Zo is de test opgezet

De benchmark, Contradiction Benchmark genaamd, bevat 1.164 gevallen waarin de hoofdclaim van een paper in tegenspraak is met het eigen bewijs. Sakana AI testte zijn Multi-Layered Review (MLR)-agents op de benchmark en registreerde hoeveel fouten elk systeem ontdekte. De gerapporteerde cijfers zijn afkomstig uit Sakana AI’s eigen evaluatie.

Waarom het ertoe doet

Als peerreviewtools de meeste fouten in claims kunnen opsporen, krijgen onderzoekers mogelijk sneller feedback voordat ze publiceren. Voor lezers kan dat betekenen dat er minder papers met verborgen tegenstrijdigheden verschijnen. Onafhankelijke verificatie van deze resultaten is nog nodig.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.