Oossa

ИИ Sakana AI выявил 73% ошибок в научных утверждениях

Новая система проверки на базе Claude, состоящая из трёх ИИ-агентов, обнаружила 73,43% ошибок в ключевых утверждениях — намного больше предыдущего рекорда в 14,81%.

Автор: Опубликовано Oossa: 1 мин чтения

Andreea Avramescu · Unsplash

Sakana AI опубликовала в журнале Transactions on Machine Learning Research (TMLR) статью о новой системе рецензирования научных работ с помощью больших языковых моделей. В системе три агента на базе Claude совместно ищут ошибки в исследовательских утверждениях. На тесте из 1 164 известных противоречий система выявила 73,43% ошибок в ключевых утверждениях. Предыдущая лучшая система обнаружила лишь 14,81% тех же ошибок.

Как проходило тестирование

Тест, получивший название Contradiction Benchmark, включает 1 164 случая, в которых основное утверждение статьи противоречит приведённым в ней доказательствам. Sakana AI проверила на этом наборе свою систему Multi-Layered Review (MLR) и зафиксировала, сколько ошибок выявила каждая система. Приведённые результаты основаны на собственной оценке Sakana AI.

Почему это важно

Если инструменты для рецензирования научатся выявлять большинство ошибок в утверждениях, исследователи смогут быстрее получать обратную связь до публикации. Для читателей это может означать меньше статей со скрытыми противоречиями. Результаты ещё предстоит независимо проверить.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.