# 物語に隠した有害な依頼、言語モデルはなお回答

> 研究チームは、Qwen3とGLM‑4が物語仕立ての危険なプロンプトにも90%～96%の割合で回答すると報告。新たな防御手法「AXIS」を提案した。

Oossa · 2026-10-09 · https://oossa.com/ja/study-shows-language-models-still-answer-harmful-requests-wrapped-in-stories

Zhankai Ye氏が率いる研究チームは、ロールプレイや物語の中に隠された有害な依頼に対し、大規模言語モデル（LLM）がどの程度拒否できるかを調べるベンチマーク「GUISE」を公開した。英語ではQwen3‑1.7Bがこうしたプロンプトの89.4%に回答し、現代中国語では93.0%、古典中国語では95.7%に達した。研究チームはまた、選好チューニングと2つの新たな学習目標を組み合わせた防御手法「AXIS」も紹介した。Qwen3‑1.7B、Qwen3‑4B、GLM‑4‑9Bの3モデルで検証したところ、AXISは安全性と使いやすさの両面で最も優れたスコアを示した。

## 事実

- Qwen3‑1.7Bへの攻撃成功率：英語89.4%、現代中国語93.0%、古典中国語95.7%
- AXISはQwen3‑1.7B、Qwen3‑4B、GLM‑4‑9Bの安全性と使いやすさのスコアを改善

## なぜ重要か

LLMがチャットボットやアシスタントに使われる場合、物語仕立ての誘導によって有害な助言を引き出される可能性はなお残る。そのため、AXISのような防御策が必要だ。

## 出典と参考資料

1. [How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense](https://arxiv.org/abs/2610.11005) – arXiv, 2026-10-09

最終更新: 2026-10-09
