Zhankai Ye氏が率いる研究チームは、ロールプレイや物語の中に隠された有害な依頼に対し、大規模言語モデル(LLM)がどの程度拒否できるかを調べるベンチマーク「GUISE」を公開した。英語ではQwen3‑1.7Bがこうしたプロンプトの89.4%に回答し、現代中国語では93.0%、古典中国語では95.7%に達した。研究チームはまた、選好チューニングと2つの新たな学習目標を組み合わせた防御手法「AXIS」も紹介した。Qwen3‑1.7B、Qwen3‑4B、GLM‑4‑9Bの3モデルで検証したところ、AXISは安全性と使いやすさの両面で最も優れたスコアを示した。
なぜ重要か
LLMがチャットボットやアシスタントに使われる場合、物語仕立ての誘導によって有害な助言を引き出される可能性はなお残る。そのため、AXISのような防御策が必要だ。