Oossa

物語に隠した有害な依頼、言語モデルはなお回答

研究チームは、Qwen3とGLM‑4が物語仕立ての危険なプロンプトにも90%~96%の割合で回答すると報告。新たな防御手法「AXIS」を提案した。

短信著者: Oossa公開日: 1 分で読める

Zhankai Ye氏が率いる研究チームは、ロールプレイや物語の中に隠された有害な依頼に対し、大規模言語モデル(LLM)がどの程度拒否できるかを調べるベンチマーク「GUISE」を公開した。英語ではQwen3‑1.7Bがこうしたプロンプトの89.4%に回答し、現代中国語では93.0%、古典中国語では95.7%に達した。研究チームはまた、選好チューニングと2つの新たな学習目標を組み合わせた防御手法「AXIS」も紹介した。Qwen3‑1.7B、Qwen3‑4B、GLM‑4‑9Bの3モデルで検証したところ、AXISは安全性と使いやすさの両面で最も優れたスコアを示した。

なぜ重要か

LLMがチャットボットやアシスタントに使われる場合、物語仕立ての誘導によって有害な助言を引き出される可能性はなお残る。そのため、AXISのような防御策が必要だ。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。