Команда под руководством Чжанкая Е представила тест GUISE, который проверяет, отказывают ли большие языковые модели (LLM) выполнять опасные запросы, скрытые в ролевой игре или истории. На английском языке Qwen3‑1.7B отвечала на 89.4% таких запросов; на современном китайском показатель составлял 93.0%, а на классическом китайском — 95.7%. Авторы также предложили метод защиты AXIS, сочетающий настройку на основе предпочтений с двумя новыми целями обучения. Среди трех моделей — Qwen3‑1.7B, Qwen3‑4B и GLM‑4‑9B — AXIS обеспечил наилучший баланс безопасности и удобства использования.
Почему это важно
Если большие языковые модели используются в чат-ботах или помощниках, повествовательные уловки всё еще могут заставить их давать опасные советы. Поэтому необходимы более эффективные методы защиты, такие как AXIS.