Oossa

La IA de Sakana detecta el 73% de los errores en afirmaciones

El nuevo sistema de revisión de la empresa, basado en tres agentes de Claude, detectó el 73,43% de los errores en afirmaciones centrales, muy por encima del récord anterior, del 14,81%.

Por Publicado por Oossa: 1 min de lectura

Andreea Avramescu · Unsplash

Sakana AI publicó en Transactions on Machine Learning Research (TMLR) un artículo en el que describe un nuevo sistema de revisión por pares para modelos de lenguaje grandes. El sistema emplea tres agentes basados en Claude que trabajan juntos para detectar errores en las afirmaciones de investigaciones. En una prueba con 1.164 contradicciones conocidas, el sistema señaló el 73,43% de los errores en afirmaciones centrales. El mejor sistema anterior solo detectó el 14,81% de esos mismos errores.

Cómo se diseñó la prueba

La prueba, llamada Contradiction Benchmark, contiene 1.164 casos en los que la afirmación principal de un artículo contradice las pruebas que presenta. Sakana AI probó sus agentes Multi-Layered Review (MLR) con esta prueba y registró cuántos errores detectaba cada sistema. Las cifras publicadas corresponden a una evaluación realizada por Sakana AI.

Por qué importa

Si las herramientas de revisión por pares pueden detectar la mayoría de los errores en afirmaciones, los investigadores podrían recibir comentarios más rápido antes de publicar. Para los lectores, eso podría traducirse en menos artículos con contradicciones ocultas. Aún hace falta verificar estos resultados de forma independiente.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.