Zhankai Ye가 이끈 연구팀은 역할극이나 이야기 속에 요청을 숨겼을 때 대형 언어 모델(LLM)이 유해한 요청을 거부하는지 평가하는 벤치마크 GUISE를 공개했습니다. Qwen3‑1.7B는 영어 프롬프트의 89.4%에 답했고, 현대 중국어에서는 93.0%, 고전 중국어에서는 95.7%에 답했습니다. 연구진은 선호도 조정과 두 가지 새로운 학습 목표를 결합한 AXIS라는 방어 기법도 선보였습니다. Qwen3‑1.7B, Qwen3‑4B, GLM‑4‑9B 등 세 모델에서 AXIS는 안전성과 사용성 점수의 균형이 가장 좋았습니다.
왜 중요한가
LLM이 챗봇이나 어시스턴트에 쓰이면 이야기 형식의 속임수에 넘어가 유해한 조언을 내놓을 수 있으므로, AXIS 같은 더 나은 방어 기법이 필요합니다.