# Google ने लंबे कामों और नई स्कोरिंग के साथ Android Bench 2.0 लॉन्च किया

> अपडेटेड बेंचमार्क में कई दिनों तक चलने वाले डेवलपमेंट टास्क, एजेंट-आधारित मूल्यांकन और AI असिस्टेंट की Android कोडिंग क्षमता मापने के लिए ग्रेडेड स्कोरिंग जोड़ी गई है।

Oossa · 2026-10-09 · https://oossa.com/hi/google-launches-android-bench-2-0-with-long-horizon-tasks-and-new-scoring

Google ने AI मॉडल्स के लिए अपने Android डेवलपमेंट बेंचमार्क का अपडेट Android Bench 2.0 जारी किया है। नए वर्ज़न में ऐसे लंबे काम शामिल हैं जिन्हें पूरा करने में किसी इंजीनियर को कई दिन या एक हफ्ता लग सकता है। इसमें केवल कोड के छोटे हिस्सों के बजाय एजेंट्स का मूल्यांकन किया जाता है। अब साधारण पास/फेल नतीजे की जगह लगातार पैमाने पर स्कोर दिया जाता है, जिसमें कामकाज, दृश्य समानता और निर्देशों का पालन परखा जाता है। डैशबोर्ड के मुताबिक, सबसे कठिन कामों में Claude Opus 5.5 सबसे आगे है, जिसका पास रेट 32% है।

## तथ्य

- Android Bench 2.0 की घोषणा 2026-10-09 को की गई ("Fri Oct 09 2026 19:00:00 GMT+0200").
- LHT लीडरबोर्ड में Claude Opus 5.5 32% पास रेट के साथ शीर्ष पर रहा।

## यह क्यों मायने रखता है

डेवलपर इस बेंचमार्क से जान सकते हैं कि जटिल Android प्रोजेक्ट्स के लिए कौन-से AI असिस्टेंट सबसे भरोसेमंद हैं।

## स्रोत और संदर्भ

1. [Android Bench 2 Adds Support for Long-Horizon Tasks, Agentic Evaluation, and Continuous Scoring](https://www.infoq.com/news/2026/10/android-bench-2/?utm_campaign=infoq_content&utm_source=infoq&utm_medium=feed&utm_term=AI%2C+ML+%26+Data+Engineering) – InfoQ, 2026-10-09

अंतिम अपडेट: 2026-10-09
