Oossa

هوش مصنوعی Sakana AI در آزمایش ۷۳٪ خطاهای ادعاها را یافت

سامانه جدید این شرکت، متشکل از سه عامل مبتنی بر Claude، ۷۳٫۴۳٪ خطاهای ادعاهای اصلی را پیدا کرد؛ بسیار بیشتر از رکورد قبلیِ ۱۴٫۸۱٪.

نویسنده: منتشرشده توسط Oossa: 1 دقیقه مطالعه

Andreea Avramescu · Unsplash

Sakana AI مقاله‌ای در نشریه Transactions on Machine Learning Research (TMLR) منتشر کرده که در آن سامانه‌ای تازه برای داوری همتا در مدل‌های زبانی بزرگ معرفی شده است. این سامانه از سه عامل مبتنی بر Claude استفاده می‌کند که برای یافتن اشتباه‌ها در ادعاهای پژوهشی با یکدیگر همکاری می‌کنند. در آزمونی شامل ۱٬۱۶۴ تناقضِ شناخته‌شده، سامانه ۷۳٫۴۳٪ خطاهای ادعاهای اصلی را شناسایی کرد. بهترین سامانه پیشین فقط ۱۴٫۸۱٪ از همین خطاها را پیدا کرده بود.

آزمون چگونه طراحی شد

این معیارسنجی که Contradiction Benchmark نام دارد، شامل ۱٬۱۶۴ موردی است که در آن ادعای اصلی یک مقاله با شواهد همان مقاله تناقض دارد. Sakana AI عامل‌های Multi-Layered Review (MLR) خود را با این معیارسنجی آزمایش کرد و تعداد خطاهای شناسایی‌شده را برای هر سامانه ثبت کرد. ارقام گزارش‌شده حاصل ارزیابی خود Sakana AI است.

چرا مهم است

اگر ابزارهای داوری همتا بتوانند بیشتر خطاهای ادعاها را پیدا کنند، پژوهشگران ممکن است پیش از انتشار بازخورد سریع‌تری بگیرند. برای خوانندگان، این می‌تواند به معنای انتشار مقاله‌های کمتری با تناقض‌های پنهان باشد. با این حال، هنوز به راستی‌آزمایی مستقل این نتایج نیاز است.

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.