Sakana AI publicó en Transactions on Machine Learning Research (TMLR) un artículo en el que describe un nuevo sistema de revisión por pares para modelos de lenguaje grandes. El sistema emplea tres agentes basados en Claude que trabajan juntos para detectar errores en las afirmaciones de investigaciones. En una prueba con 1.164 contradicciones conocidas, el sistema señaló el 73,43% de los errores en afirmaciones centrales. El mejor sistema anterior solo detectó el 14,81% de esos mismos errores.
Cómo se diseñó la prueba
La prueba, llamada Contradiction Benchmark, contiene 1.164 casos en los que la afirmación principal de un artículo contradice las pruebas que presenta. Sakana AI probó sus agentes Multi-Layered Review (MLR) con esta prueba y registró cuántos errores detectaba cada sistema. Las cifras publicadas corresponden a una evaluación realizada por Sakana AI.
Por qué importa
Si las herramientas de revisión por pares pueden detectar la mayoría de los errores en afirmaciones, los investigadores podrían recibir comentarios más rápido antes de publicar. Para los lectores, eso podría traducirse en menos artículos con contradicciones ocultas. Aún hace falta verificar estos resultados de forma independiente.