Sakana AI опубликовала в журнале Transactions on Machine Learning Research (TMLR) статью о новой системе рецензирования научных работ с помощью больших языковых моделей. В системе три агента на базе Claude совместно ищут ошибки в исследовательских утверждениях. На тесте из 1 164 известных противоречий система выявила 73,43% ошибок в ключевых утверждениях. Предыдущая лучшая система обнаружила лишь 14,81% тех же ошибок.
Как проходило тестирование
Тест, получивший название Contradiction Benchmark, включает 1 164 случая, в которых основное утверждение статьи противоречит приведённым в ней доказательствам. Sakana AI проверила на этом наборе свою систему Multi-Layered Review (MLR) и зафиксировала, сколько ошибок выявила каждая система. Приведённые результаты основаны на собственной оценке Sakana AI.
Почему это важно
Если инструменты для рецензирования научатся выявлять большинство ошибок в утверждениях, исследователи смогут быстрее получать обратную связь до публикации. Для читателей это может означать меньше статей со скрытыми противоречиями. Результаты ещё предстоит независимо проверить.