Oossa

Google ने लंबे कामों और नई स्कोरिंग के साथ Android Bench 2.0 लॉन्च किया

अपडेटेड बेंचमार्क में कई दिनों तक चलने वाले डेवलपमेंट टास्क, एजेंट-आधारित मूल्यांकन और AI असिस्टेंट की Android कोडिंग क्षमता मापने के लिए ग्रेडेड स्कोरिंग जोड़ी गई है।

संक्षिप्तलेखक: Oossa द्वारा प्रकाशित: 1 मिनट पढ़ना

Google ने AI मॉडल्स के लिए अपने Android डेवलपमेंट बेंचमार्क का अपडेट Android Bench 2.0 जारी किया है। नए वर्ज़न में ऐसे लंबे काम शामिल हैं जिन्हें पूरा करने में किसी इंजीनियर को कई दिन या एक हफ्ता लग सकता है। इसमें केवल कोड के छोटे हिस्सों के बजाय एजेंट्स का मूल्यांकन किया जाता है। अब साधारण पास/फेल नतीजे की जगह लगातार पैमाने पर स्कोर दिया जाता है, जिसमें कामकाज, दृश्य समानता और निर्देशों का पालन परखा जाता है। डैशबोर्ड के मुताबिक, सबसे कठिन कामों में Claude Opus 5.5 सबसे आगे है, जिसका पास रेट 32% है।

यह क्यों मायने रखता है

डेवलपर इस बेंचमार्क से जान सकते हैं कि जटिल Android प्रोजेक्ट्स के लिए कौन-से AI असिस्टेंट सबसे भरोसेमंद हैं।

क्या यह लेख उपयोगी था?
साझा करें

यह भी पढ़ें

Oossa · न्यूज़लेटर

AI का हफ़्ता, आसान भाषा में

हर सोमवार: जानने लायक खबरें, सरल भाषा में। मुफ़्त, कोई स्पैम नहीं।