# ИИ Sakana AI выявил 73% ошибок в научных утверждениях

> Новая система проверки на базе Claude, состоящая из трёх ИИ-агентов, обнаружила 73,43% ошибок в ключевых утверждениях — намного больше предыдущего рекорда в 14,81%.

Oossa · 2026-10-11 · https://oossa.com/ru/sakana-ai-s-review-ai-catches-73-of-claim-errors-in-test

Sakana AI опубликовала в журнале Transactions on Machine Learning Research (TMLR) статью о новой системе рецензирования научных работ с помощью больших языковых моделей. В системе три агента на базе Claude совместно ищут ошибки в исследовательских утверждениях. На тесте из 1 164 известных противоречий система выявила 73,43% ошибок в ключевых утверждениях. Предыдущая лучшая система обнаружила лишь 14,81% тех же ошибок.

## Как проходило тестирование

Тест, получивший название Contradiction Benchmark, включает 1 164 случая, в которых основное утверждение статьи противоречит приведённым в ней доказательствам. Sakana AI проверила на этом наборе свою систему Multi-Layered Review (MLR) и зафиксировала, сколько ошибок выявила каждая система. Приведённые результаты основаны на собственной оценке Sakana AI.

## Факты

- В системе Multi-Layered Review от Sakana AI работают три рецензента-агента на базе Claude.
- Систему проверили на Contradiction Benchmark, включающем 1 164 ошибки.
- MLR выявила 73,43% ошибок в ключевых утверждениях.
- Предыдущая лучшая система выявила лишь 14,81% таких ошибок.
- Результаты опубликованы в статье TMLR 10 октября 2026 года.

## Почему это важно

Если инструменты для рецензирования научатся выявлять большинство ошибок в утверждениях, исследователи смогут быстрее получать обратную связь до публикации. Для читателей это может означать меньше статей со скрытыми противоречиями. Результаты ещё предстоит независимо проверить.

## Источники и ссылки

1. [Sakana AI’s LLM Peer Review System Catches 73% of Core-Claim Errors](https://www.marktechpost.com/2026/10/10/sakana-ais-llm-peer-review-system-catches-73-of-core-claim-errors/) – MarkTechPost, 2026-10-10

Обновлено: 2026-10-11
