# Google تطلق Android Bench 2.0 بمهام طويلة الأمد وتقييم جديد

> يضيف الإصدار المحدّث مهام تطوير تمتد لأيام، وتقييمًا قائمًا على الوكلاء، ونظامًا متدرجًا لقياس أداء مساعدات الذكاء الاصطناعي في برمجة Android.

Oossa · 2026-10-09 · https://oossa.com/ar/google-launches-android-bench-2-0-with-long-horizon-tasks-and-new-scoring

أطلقت Google الإصدار Android Bench 2.0، وهو تحديث لمعيارها المخصص لتقييم نماذج الذكاء الاصطناعي في تطوير Android. يضيف الإصدار الجديد مهامًا طويلة الأمد قد تستغرق من المهندس أيامًا أو أسبوعًا، كما يقيّم الوكلاء بدلًا من الاكتفاء بمقاطع الشيفرة البرمجية. وأصبح التقييم متدرجًا، إذ يقيس الأداء الوظيفي والدقة البصرية والالتزام بالتعليمات بدلًا من الاكتفاء بنتيجة نجاح أو إخفاق. وتُظهر لوحة المتصدرين تصدّر Claude Opus 5.5، بمعدل اجتياز بلغ 32% في أصعب المهام.

## الحقائق

- أُعلن عن Android Bench 2.0 في 2026-10-09 ("Fri Oct 09 2026 19:00:00 GMT+0200").
- تصدّر Claude Opus 5.5 قائمة LHT بمعدل اجتياز بلغ 32%. 

## لماذا يهم

يستطيع المطورون الاستفادة من هذا المعيار لمعرفة مساعدات الذكاء الاصطناعي الأكثر موثوقية في مشاريع Android المعقدة.

## المصادر والمراجع

1. [Android Bench 2 Adds Support for Long-Horizon Tasks, Agentic Evaluation, and Continuous Scoring](https://www.infoq.com/news/2026/10/android-bench-2/?utm_campaign=infoq_content&utm_source=infoq&utm_medium=feed&utm_term=AI%2C+ML+%26+Data+Engineering) – InfoQ, 2026-10-09

آخر تحديث: 2026-10-09
