Oossa

L’IA di Sakana individua il 73% degli errori nelle affermazioni

Il nuovo sistema di revisione basato su Claude e composto da tre agenti ha individuato il 73,43% degli errori nelle affermazioni principali, superando di gran lunga il precedente record del 14,81%.

Di Pubblicato da Oossa: 1 min di lettura

Andreea Avramescu · Unsplash

Sakana AI ha pubblicato su Transactions on Machine Learning Research (TMLR) uno studio che descrive un nuovo sistema di revisione tra pari per i modelli linguistici di grandi dimensioni. Il sistema si avvale di tre agenti basati su Claude che collaborano per individuare errori nelle affermazioni della ricerca. In un test su 1.164 contraddizioni note, il sistema ha segnalato il 73,43% degli errori nelle affermazioni principali. Il miglior sistema precedente aveva individuato soltanto il 14,81% degli stessi errori.

Come è stato condotto il test

Il benchmark, chiamato Contradiction Benchmark, comprende 1.164 casi in cui l’affermazione principale di uno studio contraddice le prove presentate nello studio stesso. Sakana AI ha sottoposto il benchmark ai propri agenti Multi-Layered Review (MLR) e ha registrato quanti errori rilevava ciascun sistema. I risultati riportati derivano da una valutazione condotta dalla stessa Sakana AI.

Perché conta

Se gli strumenti di revisione tra pari riescono a individuare la maggior parte degli errori nelle affermazioni, i ricercatori potrebbero ricevere un riscontro più rapido prima della pubblicazione. Per i lettori, questo potrebbe significare meno studi con contraddizioni non rilevate. I risultati devono ancora essere verificati in modo indipendente.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.