گوگل Android Bench 2.0 را منتشر کرده است؛ نسخه ارتقایافته بنچمارک این شرکت برای سنجش مدلهای هوش مصنوعی در توسعه اندروید. نسخه جدید وظایف بلندمدتی را اضافه میکند که انجامشان ممکن است چند روز یا یک هفته طول بکشد و بهجای قطعهکدها، عاملهای هوش مصنوعی را ارزیابی میکند. امتیازدهی نیز پیوسته شده و عملکرد، وفاداری بصری و پایبندی به دستورالعملها را میسنجد، نه اینکه فقط نتیجه را قبول یا رد کند. داشبورد نشان میدهد Claude Opus 5.5 با نرخ قبولی 32 درصد در دشوارترین وظایف پیشتاز است.
چرا مهم است
توسعهدهندگان میتوانند با این بنچمارک ببینند کدام دستیارهای هوش مصنوعی برای پروژههای پیچیده اندروید قابلاعتمادترند.