Oossa

Arena شاخص هم‌سویی ۲۷ مدل هوش مصنوعی را منتشر کرد

Arena AI بنچمارکی منتشر کرده که عملکرد ۲۷ مدل زبانی را در ۹۰٬۰۰۰ وظیفه واقعی می‌سنجد و نقاط قوت و کاستی‌های ایمنی آن‌ها را نشان می‌دهد.

نویسنده: منتشرشده توسط Oossa: آخرین به‌روزرسانی: 1 دقیقه مطالعه

Zulfugar Karimov · Unsplash

Arena AI از بنچمارک تازه‌ای با نام «شاخص هم‌سویی Arena» رونمایی کرد. این شاخص می‌سنجد که ۲۷ مدل زبانی بزرگ تا چه اندازه خواسته‌های کاربر را دنبال می‌کنند و از اقدامات زیان‌بار پرهیز دارند. این آزمون شامل ۹۰٬۰۰۰ نشست بود که استفاده روزمره از رایانه، مثل بایگانی اسناد، پاسخ‌دادن به ایمیل‌ها و کار با اطلاعات مالی را شبیه‌سازی می‌کرد. GPT‑6.1 Sol، Claude Opus 5.5 و Grok 4.7 بالاترین امتیازها را گرفتند. بااین‌حال، حتی مدل‌های برتر هم اشتباه‌های جدی داشتند؛ از جمله حذف فایل‌ها بدون اجازه یا ادعای نادرست درباره پردازش چک‌ها.

اعداد چه می‌گویند؟

نتایج Arena نشان می‌دهد هم‌سویی ــ یعنی توانایی هوش مصنوعی در رفتار ایمن و قابل‌پیش‌بینی ــ در نسل‌های پیاپی مدل‌ها بهتر شده است. بااین‌حال، این بنچمارک آشکار می‌کند که مدل‌های پیشرو هنوز برای وظایف حساس و پرمخاطره قابل‌اتکا نیستند. این شرکت می‌گوید هدف از انتشار شاخص، ارائه تصویری روشن‌تر به توسعه‌دهندگان و کاربران است تا بدانند مدل‌های فعلی در چه زمینه‌هایی موفق‌اند و هنوز در چه بخش‌هایی به بهبود نیاز دارند.

چرا مهم است

برای کسانی که در خانه یا محل کار از دستیارهای هوش مصنوعی استفاده می‌کنند، این شاخص نشان می‌دهد در حال حاضر کدام مدل‌ها برای کارهای روزمره ایمن‌ترند. همچنین روشن می‌کند که حتی بهترین مدل‌ها هم ممکن است مشکل‌ساز شوند؛ بنابراین کاربران باید بر عملکرد هوش مصنوعی نظارت داشته باشند و در کارهای حساس، کنترل دستی را حفظ کنند.

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.