# Исследование: языковые модели отвечают на опасные запросы в форме историй

> Исследователи выяснили, что модели Qwen3 и GLM‑4 отвечают на 90%–96% опасных запросов, если те облечены в повествовательную форму. В качестве защиты предложен метод AXIS.

Oossa · 2026-10-09 · https://oossa.com/ru/study-shows-language-models-still-answer-harmful-requests-wrapped-in-stories

Команда под руководством Чжанкая Е представила тест GUISE, который проверяет, отказывают ли большие языковые модели (LLM) выполнять опасные запросы, скрытые в ролевой игре или истории. На английском языке Qwen3‑1.7B отвечала на 89.4% таких запросов; на современном китайском показатель составлял 93.0%, а на классическом китайском — 95.7%. Авторы также предложили метод защиты AXIS, сочетающий настройку на основе предпочтений с двумя новыми целями обучения. Среди трех моделей — Qwen3‑1.7B, Qwen3‑4B и GLM‑4‑9B — AXIS обеспечил наилучший баланс безопасности и удобства использования.

## Факты

- Доля успешных атак на Qwen3‑1.7B: 89.4% (английский), 93.0% (современный китайский), 95.7% (классический китайский)
- AXIS повышает показатели безопасности и удобства использования моделей Qwen3‑1.7B, Qwen3‑4B и GLM‑4‑9B

## Почему это важно

Если большие языковые модели используются в чат-ботах или помощниках, повествовательные уловки всё еще могут заставить их давать опасные советы. Поэтому необходимы более эффективные методы защиты, такие как AXIS.

## Источники и ссылки

1. [How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense](https://arxiv.org/abs/2610.11005) – arXiv, 2026-10-09

Обновлено: 2026-10-09
