# L’IA di Sakana individua il 73% degli errori nelle affermazioni

> Il nuovo sistema di revisione basato su Claude e composto da tre agenti ha individuato il 73,43% degli errori nelle affermazioni principali, superando di gran lunga il precedente record del 14,81%.

Oossa · 2026-10-11 · https://oossa.com/it/sakana-ai-s-review-ai-catches-73-of-claim-errors-in-test

Sakana AI ha pubblicato su Transactions on Machine Learning Research (TMLR) uno studio che descrive un nuovo sistema di revisione tra pari per i modelli linguistici di grandi dimensioni. Il sistema si avvale di tre agenti basati su Claude che collaborano per individuare errori nelle affermazioni della ricerca. In un test su 1.164 contraddizioni note, il sistema ha segnalato il 73,43% degli errori nelle affermazioni principali. Il miglior sistema precedente aveva individuato soltanto il 14,81% degli stessi errori.

## Come è stato condotto il test

Il benchmark, chiamato Contradiction Benchmark, comprende 1.164 casi in cui l’affermazione principale di uno studio contraddice le prove presentate nello studio stesso. Sakana AI ha sottoposto il benchmark ai propri agenti Multi-Layered Review (MLR) e ha registrato quanti errori rilevava ciascun sistema. I risultati riportati derivano da una valutazione condotta dalla stessa Sakana AI.

## I fatti

- Il sistema Multi-Layered Review di Sakana AI si avvale di tre agenti revisori basati su Claude.
- Il sistema è stato testato su un Contradiction Benchmark composto da 1.164 errori.
- MLR ha individuato il 73,43% degli errori nelle affermazioni principali.
- Il precedente sistema migliore aveva individuato soltanto il 14,81% di quegli errori.
- I risultati sono stati pubblicati in uno studio su TMLR il 10 ottobre 2026.

## Perché conta

Se gli strumenti di revisione tra pari riescono a individuare la maggior parte degli errori nelle affermazioni, i ricercatori potrebbero ricevere un riscontro più rapido prima della pubblicazione. Per i lettori, questo potrebbe significare meno studi con contraddizioni non rilevate. I risultati devono ancora essere verificati in modo indipendente.

## Fonti e riferimenti

1. [Sakana AI’s LLM Peer Review System Catches 73% of Core-Claim Errors](https://www.marktechpost.com/2026/10/10/sakana-ais-llm-peer-review-system-catches-73-of-core-claim-errors/) – MarkTechPost, 2026-10-10

Ultimo aggiornamento: 2026-10-11
