· 1 분 읽기
새 모델, 노력에 따라 AI 탈옥 공격이 어떻게 늘어나는지 예측
마르코 비롤리가 이끄는 연구진은 2026년 9월 29일, 공격자가 프롬프트를 더 많이 시도할수록 탈옥 성공률이 얼마나 높아지는지 추정하는 간단한 공식을 제시한 논문을 공개했다.
Oossa · Oossa 소개
컴퓨터 과학자 마르코 비롤리는 2026년 9월 29일 arXiv에 「정렬에서 벗어나기: Best-of-N 탈옥의 물리적 장벽 모델」이라는 논문을 올렸다. 이 연구는 공격자가 두 가지 변수, 즉 프롬프트 변형의 수(N)와 변형 하나당 응답 수(M)를 늘릴 때 탈옥 공격의 성공률이 어떻게 달라지는지 설명하는 간단한 ‘장벽 모델’을 제시한다. 이 모델은 안전장치와 관련된 숫자 네 개만 사용하지만, 지금까지 시험된 것보다 훨씬 큰 규모의 공격 결과도 예측할 수 있다.
새 모델은 어떤 역할을 하나?
이 모델은 각 프롬프트에 기본 안전 수준이 있다고 본 뒤, 공격자가 충분히 다양한 시도를 하면 넘을 수 있는 무작위 ‘장벽’을 더한다. 저자들은 서로 다른 언어 모델 다섯 종의 데이터에 네 개의 숫자를 맞춰, 다섯 모델 모두가 같은 스케일링 곡선에 들어맞는다는 것을 보였다. 이는 프롬프트 변형을 최대 100개까지 사용한 실험 결과를 변형 10,000개를 쓰는 상황까지 외삽할 수 있다는 뜻이다. 앞선 연구에서는 이를 신뢰성 있게 해내지 못했다.
논문은 AI 출력의 무작위성을 조절하는 설정값인 생성 온도가 공격 성공률에 미치는 영향도 살펴본다. 저자들은 같은 네 개의 숫자를 이용해 실험하지 않은 온도에서의 성공률도 예측할 수 있다.
AI 안전에 중요한 이유
모델의 예측이 실제로 들어맞는다면, 안전 엔지니어는 탈옥 가능성이 커지기 전에 공격자가 프롬프트를 몇 가지나 변형해야 하는지 추정할 수 있다. 이는 공개 API에서 허용할 프롬프트 횟수를 현실적으로 설정하거나 의심스러운 패턴을 얼마나 적극적으로 감시할지 결정하는 데 도움이 된다.
이 연구는 공격 성공률이 N에 따라 단순한 멱법칙을 따른다는 기존 주장에도 의문을 제기한다. 온도에 따라 달라지는 더 복잡한 곡선을 보여줌으로써, 방어책은 시도 횟수뿐 아니라 여러 요인을 고려해야 한다고 시사한다.
왜 중요한가
이 모델은 AI 개발자가 공격자가 안전장치를 무너뜨리기 얼마나 어려운지 빠르게 가늠하도록 해 API 사용 제한과 모니터링 도구를 마련하는 데 도움을 준다. 또한 시도 횟수처럼 단일 지표에만 의존하면 탈옥을 더 쉽게 만드는 다른 요인을 놓칠 수 있다고 경고한다.
출처 및 참고 자료
| # | 출처 | 매체 | 날짜 | 핵심 내용 |
|---|---|---|---|---|
| 1 | Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking ↗ | arXiv | 2026. 9. 29. | arXiv:2609.32116v1 Announce Type: new Abstract: Best-of-$N$ jailbreaking (BoN) bypasses safeguards of aligned models by drawing $N$ independ |
1 개 출처
최종 업데이트:
Oossa · 뉴스레터
이번 주 AI, 쉽게 정리
매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.