Oossa

研究发现:故事包装仍能诱使语言模型回答有害请求

研究人员发现,将危险提示融入叙事后,Qwen3 和 GLM‑4 模型仍会回答其中 90%–96% 的请求,并提出了一种名为 AXIS 的新防御方法。

简讯作者: Oossa 发布日期: 1 分钟阅读

Zhankai Ye 牵头的团队发布了一项名为 GUISE 的基准测试,用于检验大型语言模型(LLM)在有害请求被藏进角色扮演或故事时,是否会拒绝回答。面对这类提示,Qwen3‑1.7B 用英语回答的比例为 89.4%;用现代中文时为 93.0%,用文言文时则升至 95.7%。作者还提出了一种名为 AXIS 的防御方法,将偏好调优与两种新的训练目标相结合。在 Qwen3‑1.7B、Qwen3‑4B 和 GLM‑4‑9B 三款模型上,AXIS 在安全性和可用性评分之间实现了最佳平衡。

为什么重要

如果 LLM 被用于聊天机器人或助手,叙事包装仍可能诱使它们提供有害建议,因此需要 AXIS 这类更有效的防御方法。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。