Oossa

Google تطلق Android Bench 2.0 بمهام طويلة الأمد وتقييم جديد

يضيف الإصدار المحدّث مهام تطوير تمتد لأيام، وتقييمًا قائمًا على الوكلاء، ونظامًا متدرجًا لقياس أداء مساعدات الذكاء الاصطناعي في برمجة Android.

خبر موجزبقلم نشرته Oossa: 1 دقائق قراءة

أطلقت Google الإصدار Android Bench 2.0، وهو تحديث لمعيارها المخصص لتقييم نماذج الذكاء الاصطناعي في تطوير Android. يضيف الإصدار الجديد مهامًا طويلة الأمد قد تستغرق من المهندس أيامًا أو أسبوعًا، كما يقيّم الوكلاء بدلًا من الاكتفاء بمقاطع الشيفرة البرمجية. وأصبح التقييم متدرجًا، إذ يقيس الأداء الوظيفي والدقة البصرية والالتزام بالتعليمات بدلًا من الاكتفاء بنتيجة نجاح أو إخفاق. وتُظهر لوحة المتصدرين تصدّر Claude Opus 5.5، بمعدل اجتياز بلغ 32% في أصعب المهام.

لماذا يهم

يستطيع المطورون الاستفادة من هذا المعيار لمعرفة مساعدات الذكاء الاصطناعي الأكثر موثوقية في مشاريع Android المعقدة.

هل كان هذا المقال مفيدًا؟
مشاركة

اقرأ أيضًا

Oossa · النشرة البريدية

أسبوع الذكاء الاصطناعي، مشروحًا

كل يوم اثنين: الأخبار التي تستحق المعرفة، بلغة بسيطة. مجانًا وبلا رسائل مزعجة.