Zhankai Ye 牵头的团队发布了一项名为 GUISE 的基准测试,用于检验大型语言模型(LLM)在有害请求被藏进角色扮演或故事时,是否会拒绝回答。面对这类提示,Qwen3‑1.7B 用英语回答的比例为 89.4%;用现代中文时为 93.0%,用文言文时则升至 95.7%。作者还提出了一种名为 AXIS 的防御方法,将偏好调优与两种新的训练目标相结合。在 Qwen3‑1.7B、Qwen3‑4B 和 GLM‑4‑9B 三款模型上,AXIS 在安全性和可用性评分之间实现了最佳平衡。
为什么重要
如果 LLM 被用于聊天机器人或助手,叙事包装仍可能诱使它们提供有害建议,因此需要 AXIS 这类更有效的防御方法。