Oossa

Исследование: языковые модели отвечают на опасные запросы в форме историй

Исследователи выяснили, что модели Qwen3 и GLM‑4 отвечают на 90%–96% опасных запросов, если те облечены в повествовательную форму. В качестве защиты предложен метод AXIS.

ЗаметкаАвтор: Опубликовано Oossa: 1 мин чтения

Команда под руководством Чжанкая Е представила тест GUISE, который проверяет, отказывают ли большие языковые модели (LLM) выполнять опасные запросы, скрытые в ролевой игре или истории. На английском языке Qwen3‑1.7B отвечала на 89.4% таких запросов; на современном китайском показатель составлял 93.0%, а на классическом китайском — 95.7%. Авторы также предложили метод защиты AXIS, сочетающий настройку на основе предпочтений с двумя новыми целями обучения. Среди трех моделей — Qwen3‑1.7B, Qwen3‑4B и GLM‑4‑9B — AXIS обеспечил наилучший баланс безопасности и удобства использования.

Почему это важно

Если большие языковые модели используются в чат-ботах или помощниках, повествовательные уловки всё еще могут заставить их давать опасные советы. Поэтому необходимы более эффективные методы защиты, такие как AXIS.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.