Oossa

이야기 속 유해 요청에 여전히 답하는 언어 모델

연구진은 Qwen3와 GLM‑4 모델이 이야기 형식으로 감싼 위험한 프롬프트에도 90%~96% 답한다고 밝혔으며, AXIS라는 새로운 방어 기법을 제안했습니다.

짧은 소식작성: Oossa 게시일: 1 분 읽기

Zhankai Ye가 이끈 연구팀은 역할극이나 이야기 속에 요청을 숨겼을 때 대형 언어 모델(LLM)이 유해한 요청을 거부하는지 평가하는 벤치마크 GUISE를 공개했습니다. Qwen3‑1.7B는 영어 프롬프트의 89.4%에 답했고, 현대 중국어에서는 93.0%, 고전 중국어에서는 95.7%에 답했습니다. 연구진은 선호도 조정과 두 가지 새로운 학습 목표를 결합한 AXIS라는 방어 기법도 선보였습니다. Qwen3‑1.7B, Qwen3‑4B, GLM‑4‑9B 등 세 모델에서 AXIS는 안전성과 사용성 점수의 균형이 가장 좋았습니다.

왜 중요한가

LLM이 챗봇이나 어시스턴트에 쓰이면 이야기 형식의 속임수에 넘어가 유해한 조언을 내놓을 수 있으므로, AXIS 같은 더 나은 방어 기법이 필요합니다.

이 기사가 도움이 되었나요?
공유

다음 읽을거리

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.