Sakana AI مقالهای در نشریه Transactions on Machine Learning Research (TMLR) منتشر کرده که در آن سامانهای تازه برای داوری همتا در مدلهای زبانی بزرگ معرفی شده است. این سامانه از سه عامل مبتنی بر Claude استفاده میکند که برای یافتن اشتباهها در ادعاهای پژوهشی با یکدیگر همکاری میکنند. در آزمونی شامل ۱٬۱۶۴ تناقضِ شناختهشده، سامانه ۷۳٫۴۳٪ خطاهای ادعاهای اصلی را شناسایی کرد. بهترین سامانه پیشین فقط ۱۴٫۸۱٪ از همین خطاها را پیدا کرده بود.
آزمون چگونه طراحی شد
این معیارسنجی که Contradiction Benchmark نام دارد، شامل ۱٬۱۶۴ موردی است که در آن ادعای اصلی یک مقاله با شواهد همان مقاله تناقض دارد. Sakana AI عاملهای Multi-Layered Review (MLR) خود را با این معیارسنجی آزمایش کرد و تعداد خطاهای شناساییشده را برای هر سامانه ثبت کرد. ارقام گزارششده حاصل ارزیابی خود Sakana AI است.
چرا مهم است
اگر ابزارهای داوری همتا بتوانند بیشتر خطاهای ادعاها را پیدا کنند، پژوهشگران ممکن است پیش از انتشار بازخورد سریعتری بگیرند. برای خوانندگان، این میتواند به معنای انتشار مقالههای کمتری با تناقضهای پنهان باشد. با این حال، هنوز به راستیآزمایی مستقل این نتایج نیاز است.