Exa AI ने ATLAS की घोषणा की है। यह बेंचमार्क वेब सर्च पर निर्भर AI एजेंटों की सटीकता और नतीजों की पूर्णता मापता है। इसमें गुमनाम सर्च माँग से लिए गए वास्तविक दुनिया के 547 शोध कार्य शामिल हैं। बेंचमार्क दिखाता है कि सबसे महँगे एजेंट भी सही नतीजों का करीब एक-तिहाई हिस्सा चूक जाते हैं और प्रति कार्य $1 से कम लागत वाली कोई भी प्रणाली 0.5 से अधिक row F1 स्कोर हासिल नहीं करती।
यह क्यों मायने रखता है
डेवलपर ATLAS की मदद से पता लगा सकते हैं कि कौन-से सर्च बैकएंड और एजेंट कॉन्फ़िगरेशन लागत के मुकाबले सबसे बेहतर नतीजे देते हैं। इससे अधिक भरोसेमंद AI-आधारित शोध टूल बनाने में मदद मिलेगी।