# گوگل Android Bench 2.0 را با وظایف بلندمدت عرضه کرد

> نسخه جدید این بنچمارک، وظایف توسعه چندروزه، ارزیابی عامل‌های هوش مصنوعی و نظام امتیازدهی مرحله‌ای را برای سنجش دستیارهای هوش مصنوعی در برنامه‌نویسی اندروید اضافه می‌کند.

Oossa · 2026-10-09 · https://oossa.com/fa/google-launches-android-bench-2-0-with-long-horizon-tasks-and-new-scoring

گوگل Android Bench 2.0 را منتشر کرده است؛ نسخه ارتقایافته بنچمارک این شرکت برای سنجش مدل‌های هوش مصنوعی در توسعه اندروید. نسخه جدید وظایف بلندمدتی را اضافه می‌کند که انجامشان ممکن است چند روز یا یک هفته طول بکشد و به‌جای قطعه‌کدها، عامل‌های هوش مصنوعی را ارزیابی می‌کند. امتیازدهی نیز پیوسته شده و عملکرد، وفاداری بصری و پایبندی به دستورالعمل‌ها را می‌سنجد، نه اینکه فقط نتیجه را قبول یا رد کند. داشبورد نشان می‌دهد Claude Opus 5.5 با نرخ قبولی 32 درصد در دشوارترین وظایف پیشتاز است.

## حقایق

- Android Bench 2.0 در 2026-10-09 اعلام شد («Fri Oct 09 2026 19:00:00 GMT+0200»).
- Claude Opus 5.5 در جدول رتبه‌بندی LHT با نرخ قبولی 32 درصد در جایگاه نخست قرار گرفت.

## چرا مهم است

توسعه‌دهندگان می‌توانند با این بنچمارک ببینند کدام دستیارهای هوش مصنوعی برای پروژه‌های پیچیده اندروید قابل‌اعتمادترند.

## منابع و ارجاع‌ها

1. [Android Bench 2 Adds Support for Long-Horizon Tasks, Agentic Evaluation, and Continuous Scoring](https://www.infoq.com/news/2026/10/android-bench-2/?utm_campaign=infoq_content&utm_source=infoq&utm_medium=feed&utm_term=AI%2C+ML+%26+Data+Engineering) – InfoQ, 2026-10-09

آخرین به‌روزرسانی: 2026-10-09
