# 研究发现：故事包装仍能诱使语言模型回答有害请求

> 研究人员发现，将危险提示融入叙事后，Qwen3 和 GLM‑4 模型仍会回答其中 90%–96% 的请求，并提出了一种名为 AXIS 的新防御方法。

Oossa · 2026-10-09 · https://oossa.com/zh/study-shows-language-models-still-answer-harmful-requests-wrapped-in-stories

Zhankai Ye 牵头的团队发布了一项名为 GUISE 的基准测试，用于检验大型语言模型（LLM）在有害请求被藏进角色扮演或故事时，是否会拒绝回答。面对这类提示，Qwen3‑1.7B 用英语回答的比例为 89.4%；用现代中文时为 93.0%，用文言文时则升至 95.7%。作者还提出了一种名为 AXIS 的防御方法，将偏好调优与两种新的训练目标相结合。在 Qwen3‑1.7B、Qwen3‑4B 和 GLM‑4‑9B 三款模型上，AXIS 在安全性和可用性评分之间实现了最佳平衡。

## 事实

- Qwen3‑1.7B 的攻击成功率：英语 89.4%、现代中文 93.0%、文言文 95.7%
- AXIS 提升了 Qwen3‑1.7B、Qwen3‑4B 和 GLM‑4‑9B 的安全性与可用性评分

## 为什么重要

如果 LLM 被用于聊天机器人或助手，叙事包装仍可能诱使它们提供有害建议，因此需要 AXIS 这类更有效的防御方法。

## 来源与参考

1. [How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense](https://arxiv.org/abs/2610.11005) – arXiv, 2026-10-09

最后更新: 2026-10-09
