# 이야기 속 유해 요청에 여전히 답하는 언어 모델

> 연구진은 Qwen3와 GLM‑4 모델이 이야기 형식으로 감싼 위험한 프롬프트에도 90%~96% 답한다고 밝혔으며, AXIS라는 새로운 방어 기법을 제안했습니다.

Oossa · 2026-10-09 · https://oossa.com/ko/study-shows-language-models-still-answer-harmful-requests-wrapped-in-stories

Zhankai Ye가 이끈 연구팀은 역할극이나 이야기 속에 요청을 숨겼을 때 대형 언어 모델(LLM)이 유해한 요청을 거부하는지 평가하는 벤치마크 GUISE를 공개했습니다. Qwen3‑1.7B는 영어 프롬프트의 89.4%에 답했고, 현대 중국어에서는 93.0%, 고전 중국어에서는 95.7%에 답했습니다. 연구진은 선호도 조정과 두 가지 새로운 학습 목표를 결합한 AXIS라는 방어 기법도 선보였습니다. Qwen3‑1.7B, Qwen3‑4B, GLM‑4‑9B 등 세 모델에서 AXIS는 안전성과 사용성 점수의 균형이 가장 좋았습니다.

## 팩트

- Qwen3‑1.7B에 대한 공격 성공률: 영어 89.4%, 현대 중국어 93.0%, 고전 중국어 95.7%
- AXIS는 Qwen3‑1.7B, Qwen3‑4B, GLM‑4‑9B의 안전성·사용성 점수를 개선합니다

## 왜 중요한가

LLM이 챗봇이나 어시스턴트에 쓰이면 이야기 형식의 속임수에 넘어가 유해한 조언을 내놓을 수 있으므로, AXIS 같은 더 나은 방어 기법이 필요합니다.

## 출처 및 참고 자료

1. [How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense](https://arxiv.org/abs/2610.11005) – arXiv, 2026-10-09

최종 업데이트: 2026-10-09
