Oossa

IA da Sakana AI detecta 73% dos erros em teste

O novo sistema de revisão da empresa, baseado em três agentes Claude, identificou 73.43% dos erros nas alegações centrais, muito acima do melhor resultado anterior, de 14.81%.

Por Publicado pelo Oossa: 1 min de leitura

Andreea Avramescu · Unsplash

A Sakana AI publicou um artigo na Transactions on Machine Learning Research (TMLR) que descreve um novo sistema de revisão por pares para grandes modelos de linguagem. O sistema usa três agentes baseados em Claude, que trabalham em conjunto para identificar erros nas alegações de pesquisas. Em um benchmark com 1,164 contradições conhecidas, o sistema sinalizou 73.43% dos erros nas alegações centrais. O melhor sistema anterior detectou apenas 14.81% dos mesmos erros.

Como o teste foi feito

O benchmark, chamado Contradiction Benchmark, contém 1,164 casos em que a alegação principal de um artigo contradiz as evidências apresentadas no próprio trabalho. A Sakana AI aplicou ao benchmark seus agentes Multi-Layered Review (MLR) e registrou quantos erros cada sistema detectou. Os números divulgados vêm de uma avaliação feita pela própria Sakana AI.

Por que importa

Se ferramentas de revisão por pares conseguirem identificar a maioria dos erros nas alegações, os pesquisadores poderão receber comentários mais rapidamente antes de publicar. Para os leitores, isso pode significar menos artigos com contradições ocultas. Ainda é necessária uma verificação independente desses resultados.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.