أطلقت Google الإصدار Android Bench 2.0، وهو تحديث لمعيارها المخصص لتقييم نماذج الذكاء الاصطناعي في تطوير Android. يضيف الإصدار الجديد مهامًا طويلة الأمد قد تستغرق من المهندس أيامًا أو أسبوعًا، كما يقيّم الوكلاء بدلًا من الاكتفاء بمقاطع الشيفرة البرمجية. وأصبح التقييم متدرجًا، إذ يقيس الأداء الوظيفي والدقة البصرية والالتزام بالتعليمات بدلًا من الاكتفاء بنتيجة نجاح أو إخفاق. وتُظهر لوحة المتصدرين تصدّر Claude Opus 5.5، بمعدل اجتياز بلغ 32% في أصعب المهام.
لماذا يهم
يستطيع المطورون الاستفادة من هذا المعيار لمعرفة مساعدات الذكاء الاصطناعي الأكثر موثوقية في مشاريع Android المعقدة.