Google ने AI मॉडल्स के लिए अपने Android डेवलपमेंट बेंचमार्क का अपडेट Android Bench 2.0 जारी किया है। नए वर्ज़न में ऐसे लंबे काम शामिल हैं जिन्हें पूरा करने में किसी इंजीनियर को कई दिन या एक हफ्ता लग सकता है। इसमें केवल कोड के छोटे हिस्सों के बजाय एजेंट्स का मूल्यांकन किया जाता है। अब साधारण पास/फेल नतीजे की जगह लगातार पैमाने पर स्कोर दिया जाता है, जिसमें कामकाज, दृश्य समानता और निर्देशों का पालन परखा जाता है। डैशबोर्ड के मुताबिक, सबसे कठिन कामों में Claude Opus 5.5 सबसे आगे है, जिसका पास रेट 32% है।
यह क्यों मायने रखता है
डेवलपर इस बेंचमार्क से जान सकते हैं कि जटिल Android प्रोजेक्ट्स के लिए कौन-से AI असिस्टेंट सबसे भरोसेमंद हैं।