# هوش مصنوعی Sakana AI در آزمایش ۷۳٪ خطاهای ادعاها را یافت

> سامانه جدید این شرکت، متشکل از سه عامل مبتنی بر Claude، ۷۳٫۴۳٪ خطاهای ادعاهای اصلی را پیدا کرد؛ بسیار بیشتر از رکورد قبلیِ ۱۴٫۸۱٪.

Oossa · 2026-10-11 · https://oossa.com/fa/sakana-ai-s-review-ai-catches-73-of-claim-errors-in-test

Sakana AI مقاله‌ای در نشریه Transactions on Machine Learning Research (TMLR) منتشر کرده که در آن سامانه‌ای تازه برای داوری همتا در مدل‌های زبانی بزرگ معرفی شده است. این سامانه از سه عامل مبتنی بر Claude استفاده می‌کند که برای یافتن اشتباه‌ها در ادعاهای پژوهشی با یکدیگر همکاری می‌کنند. در آزمونی شامل ۱٬۱۶۴ تناقضِ شناخته‌شده، سامانه ۷۳٫۴۳٪ خطاهای ادعاهای اصلی را شناسایی کرد. بهترین سامانه پیشین فقط ۱۴٫۸۱٪ از همین خطاها را پیدا کرده بود.

## آزمون چگونه طراحی شد

این معیارسنجی که Contradiction Benchmark نام دارد، شامل ۱٬۱۶۴ موردی است که در آن ادعای اصلی یک مقاله با شواهد همان مقاله تناقض دارد. Sakana AI عامل‌های Multi-Layered Review (MLR) خود را با این معیارسنجی آزمایش کرد و تعداد خطاهای شناسایی‌شده را برای هر سامانه ثبت کرد. ارقام گزارش‌شده حاصل ارزیابی خود Sakana AI است.

## حقایق

- سامانه Multi-Layered Review شرکت Sakana AI از سه عامل داورِ مبتنی بر Claude استفاده می‌کند.
- این سامانه با معیارسنجی Contradiction Benchmark شامل ۱٬۱۶۴ خطا آزمایش شد.
- MLR توانست ۷۳٫۴۳٪ خطاهای ادعاهای اصلی را پیدا کند.
- بهترین سامانه پیشین فقط ۱۴٫۸۱٪ از این خطاها را شناسایی کرده بود.
- نتایج در مقاله‌ای در TMLR در Oct 10 2026 منتشر شد.

## چرا مهم است

اگر ابزارهای داوری همتا بتوانند بیشتر خطاهای ادعاها را پیدا کنند، پژوهشگران ممکن است پیش از انتشار بازخورد سریع‌تری بگیرند. برای خوانندگان، این می‌تواند به معنای انتشار مقاله‌های کمتری با تناقض‌های پنهان باشد. با این حال، هنوز به راستی‌آزمایی مستقل این نتایج نیاز است.

## منابع و ارجاع‌ها

1. [Sakana AI’s LLM Peer Review System Catches 73% of Core-Claim Errors](https://www.marktechpost.com/2026/10/10/sakana-ais-llm-peer-review-system-catches-73-of-core-claim-errors/) – MarkTechPost, 2026-10-10

آخرین به‌روزرسانی: 2026-10-11
