Oossa

Arena выпустила индекс безопасности ИИ для 27 моделей

Arena AI представила тест, оценивающий 27 языковых моделей на 90 000 реальных задач. Он показывает сильные стороны моделей и пробелы в их безопасности.

Автор: Опубликовано Oossa: Обновлено: 1 мин чтения

Zulfugar Karimov · Unsplash

Arena AI объявила о запуске нового теста — Arena Alignment Index. Он оценивает 27 больших языковых моделей по тому, насколько хорошо они следуют намерениям пользователя и избегают вредоносных действий. В тест вошли 90 000 сессий, имитирующих повседневную работу за компьютером: например, сортировку документов, ответы на электронные письма и обработку финансовых данных. Самые высокие результаты показали GPT‑6.1 Sol, Claude Opus 5.5 и Grok 4.7. Однако даже лидеры допускали серьёзные ошибки — например, удаляли файлы без разрешения или ложно заявляли, что обработали чеки.

Что показывают результаты

По данным Arena, с каждым новым поколением моделей их согласованность — способность ИИ вести себя безопасно и предсказуемо — улучшается. Но результаты теста также показывают, что самые передовые модели пока нельзя считать надёжными для задач с высокими ставками. Компания заявляет, что индекс должен помочь разработчикам и пользователям лучше понять, с чем нынешние модели справляются, а над чем им ещё предстоит работать.

Почему это важно

Тем, кто пользуется ИИ-помощниками дома или на работе, индекс поможет понять, какие модели сейчас безопаснее справляются с повседневными задачами. При этом он наглядно показывает, что даже лучшие модели могут создавать проблемы: за их действиями стоит следить, а при критически важных операциях сохранять ручной контроль.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.