Oossa

ذكاء Sakana AI يرصد 73% من أخطاء الادعاءات في الاختبار

نظام المراجعة الجديد من الشركة، القائم على ثلاثة وكلاء يستخدمون Claude، كشف 73.43% من أخطاء الادعاءات الأساسية، متفوقًا بفارق كبير على أفضل نظام سابق الذي رصد 14.81%.

بقلم نشرته Oossa: 1 دقائق قراءة

Andreea Avramescu · Unsplash

نشرت Sakana AI ورقة بحثية في مجلة Transactions on Machine Learning Research (TMLR) تصف نظامًا جديدًا لمراجعة الأبحاث باستخدام نماذج اللغة الكبيرة. ويعتمد النظام على ثلاثة وكلاء قائمين على Claude يعملون معًا لرصد الأخطاء في الادعاءات البحثية. وفي اختبار معياري شمل 1,164 حالة تناقض معروفة، رصد النظام 73.43% من أخطاء الادعاءات الأساسية. أما أفضل نظام سابق فلم يرصد سوى 14.81% من الأخطاء نفسها.

كيف أُجري الاختبار

يتضمن الاختبار المعياري، المعروف باسم Contradiction Benchmark، 1,164 حالة يتعارض فيها الادعاء الرئيسي لورقة بحثية مع الأدلة الواردة فيها. وشغّلت Sakana AI وكلاء نظامها Multi-Layered Review (MLR) على الاختبار، وسجلت عدد الأخطاء التي رصدها كل نظام. والأرقام المعلنة مستمدة من تقييم أجرته Sakana AI بنفسها.

لماذا يهم

إذا استطاعت أدوات مراجعة الأبحاث رصد معظم الأخطاء في الادعاءات، فقد يحصل الباحثون على ملاحظات أسرع قبل النشر. وقد يعني ذلك للقراء عددًا أقل من الأوراق التي تتضمن تناقضات خفية. لكن لا يزال من الضروري التحقق من هذه النتائج بصورة مستقلة.

هل كان هذا المقال مفيدًا؟
مشاركة

اقرأ أيضًا

Oossa · النشرة البريدية

أسبوع الذكاء الاصطناعي، مشروحًا

كل يوم اثنين: الأخبار التي تستحق المعرفة، بلغة بسيطة. مجانًا وبلا رسائل مزعجة.