نشرت Sakana AI ورقة بحثية في مجلة Transactions on Machine Learning Research (TMLR) تصف نظامًا جديدًا لمراجعة الأبحاث باستخدام نماذج اللغة الكبيرة. ويعتمد النظام على ثلاثة وكلاء قائمين على Claude يعملون معًا لرصد الأخطاء في الادعاءات البحثية. وفي اختبار معياري شمل 1,164 حالة تناقض معروفة، رصد النظام 73.43% من أخطاء الادعاءات الأساسية. أما أفضل نظام سابق فلم يرصد سوى 14.81% من الأخطاء نفسها.
كيف أُجري الاختبار
يتضمن الاختبار المعياري، المعروف باسم Contradiction Benchmark، 1,164 حالة يتعارض فيها الادعاء الرئيسي لورقة بحثية مع الأدلة الواردة فيها. وشغّلت Sakana AI وكلاء نظامها Multi-Layered Review (MLR) على الاختبار، وسجلت عدد الأخطاء التي رصدها كل نظام. والأرقام المعلنة مستمدة من تقييم أجرته Sakana AI بنفسها.
لماذا يهم
إذا استطاعت أدوات مراجعة الأبحاث رصد معظم الأخطاء في الادعاءات، فقد يحصل الباحثون على ملاحظات أسرع قبل النشر. وقد يعني ذلك للقراء عددًا أقل من الأوراق التي تتضمن تناقضات خفية. لكن لا يزال من الضروري التحقق من هذه النتائج بصورة مستقلة.