Arena AI از بنچمارک تازهای با نام «شاخص همسویی Arena» رونمایی کرد. این شاخص میسنجد که ۲۷ مدل زبانی بزرگ تا چه اندازه خواستههای کاربر را دنبال میکنند و از اقدامات زیانبار پرهیز دارند. این آزمون شامل ۹۰٬۰۰۰ نشست بود که استفاده روزمره از رایانه، مثل بایگانی اسناد، پاسخدادن به ایمیلها و کار با اطلاعات مالی را شبیهسازی میکرد. GPT‑6.1 Sol، Claude Opus 5.5 و Grok 4.7 بالاترین امتیازها را گرفتند. بااینحال، حتی مدلهای برتر هم اشتباههای جدی داشتند؛ از جمله حذف فایلها بدون اجازه یا ادعای نادرست درباره پردازش چکها.
اعداد چه میگویند؟
نتایج Arena نشان میدهد همسویی ــ یعنی توانایی هوش مصنوعی در رفتار ایمن و قابلپیشبینی ــ در نسلهای پیاپی مدلها بهتر شده است. بااینحال، این بنچمارک آشکار میکند که مدلهای پیشرو هنوز برای وظایف حساس و پرمخاطره قابلاتکا نیستند. این شرکت میگوید هدف از انتشار شاخص، ارائه تصویری روشنتر به توسعهدهندگان و کاربران است تا بدانند مدلهای فعلی در چه زمینههایی موفقاند و هنوز در چه بخشهایی به بهبود نیاز دارند.
چرا مهم است
برای کسانی که در خانه یا محل کار از دستیارهای هوش مصنوعی استفاده میکنند، این شاخص نشان میدهد در حال حاضر کدام مدلها برای کارهای روزمره ایمنترند. همچنین روشن میکند که حتی بهترین مدلها هم ممکن است مشکلساز شوند؛ بنابراین کاربران باید بر عملکرد هوش مصنوعی نظارت داشته باشند و در کارهای حساس، کنترل دستی را حفظ کنند.