Oossa

گوگل Android Bench 2.0 را با وظایف بلندمدت عرضه کرد

نسخه جدید این بنچمارک، وظایف توسعه چندروزه، ارزیابی عامل‌های هوش مصنوعی و نظام امتیازدهی مرحله‌ای را برای سنجش دستیارهای هوش مصنوعی در برنامه‌نویسی اندروید اضافه می‌کند.

خبر کوتاهنویسنده: منتشرشده توسط Oossa: 1 دقیقه مطالعه

گوگل Android Bench 2.0 را منتشر کرده است؛ نسخه ارتقایافته بنچمارک این شرکت برای سنجش مدل‌های هوش مصنوعی در توسعه اندروید. نسخه جدید وظایف بلندمدتی را اضافه می‌کند که انجامشان ممکن است چند روز یا یک هفته طول بکشد و به‌جای قطعه‌کدها، عامل‌های هوش مصنوعی را ارزیابی می‌کند. امتیازدهی نیز پیوسته شده و عملکرد، وفاداری بصری و پایبندی به دستورالعمل‌ها را می‌سنجد، نه اینکه فقط نتیجه را قبول یا رد کند. داشبورد نشان می‌دهد Claude Opus 5.5 با نرخ قبولی 32 درصد در دشوارترین وظایف پیشتاز است.

چرا مهم است

توسعه‌دهندگان می‌توانند با این بنچمارک ببینند کدام دستیارهای هوش مصنوعی برای پروژه‌های پیچیده اندروید قابل‌اعتمادترند.

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.