Sakana AI ने Transactions on Machine Learning Research (TMLR) में एक शोधपत्र प्रकाशित किया है, जिसमें बड़े भाषा मॉडल के लिए एक नई सहकर्मी-समीक्षा प्रणाली का वर्णन है। यह प्रणाली शोध के दावों में गलतियां ढूंढने के लिए Claude-आधारित तीन एजेंटों का इस्तेमाल करती है, जो मिलकर काम करते हैं। पहले से ज्ञात 1,164 विरोधाभासों पर किए गए बेंचमार्क में, प्रणाली ने मुख्य दावों से जुड़ी 73.43% त्रुटियां चिह्नित कीं। इससे पहले का सर्वश्रेष्ठ सिस्टम इन्हीं त्रुटियों में से केवल 14.81% पकड़ पाया था।
जांच कैसे की गई
Contradiction Benchmark नाम के इस बेंचमार्क में ऐसे 1,164 मामले हैं, जहां किसी शोधपत्र का मुख्य दावा उसके अपने साक्ष्यों से विरोधाभास रखता है। Sakana AI ने इस बेंचमार्क पर अपने Multi-Layered Review (MLR) एजेंट चलाए और दर्ज किया कि हर सिस्टम ने कितनी त्रुटियां पकड़ीं। बताए गए आंकड़े Sakana AI के अपने मूल्यांकन पर आधारित हैं।
यह क्यों मायने रखता है
अगर सहकर्मी-समीक्षा के उपकरण दावों की ज़्यादातर त्रुटियां पकड़ सकें, तो शोधकर्ताओं को प्रकाशित होने से पहले तेज़ी से प्रतिक्रिया मिल सकती है। पाठकों के लिए इसका मतलब यह हो सकता है कि ऐसे शोधपत्र कम हों जिनमें छिपे हुए विरोधाभास हों। इन नतीजों की स्वतंत्र पुष्टि अभी ज़रूरी है।