# 새 모델, 노력에 따라 AI 탈옥 공격이 어떻게 늘어나는지 예측

> 마르코 비롤리가 이끄는 연구진은 2026년 9월 29일, 공격자가 프롬프트를 더 많이 시도할수록 탈옥 성공률이 얼마나 높아지는지 추정하는 간단한 공식을 제시한 논문을 공개했다.

Oossa · 2026-09-29 · https://oossa.com/ko/new-model-predicts-how-ai-jailbreak-attacks-scale-with-effort

컴퓨터 과학자 마르코 비롤리는 2026년 9월 29일 arXiv에 「정렬에서 벗어나기: Best-of-N 탈옥의 물리적 장벽 모델」이라는 논문을 올렸다. 이 연구는 공격자가 두 가지 변수, 즉 프롬프트 변형의 수(N)와 변형 하나당 응답 수(M)를 늘릴 때 탈옥 공격의 성공률이 어떻게 달라지는지 설명하는 간단한 ‘장벽 모델’을 제시한다. 이 모델은 안전장치와 관련된 숫자 네 개만 사용하지만, 지금까지 시험된 것보다 훨씬 큰 규모의 공격 결과도 예측할 수 있다.

## 새 모델은 어떤 역할을 하나?

이 모델은 각 프롬프트에 기본 안전 수준이 있다고 본 뒤, 공격자가 충분히 다양한 시도를 하면 넘을 수 있는 무작위 ‘장벽’을 더한다. 저자들은 서로 다른 언어 모델 다섯 종의 데이터에 네 개의 숫자를 맞춰, 다섯 모델 모두가 같은 스케일링 곡선에 들어맞는다는 것을 보였다. 이는 프롬프트 변형을 최대 100개까지 사용한 실험 결과를 변형 10,000개를 쓰는 상황까지 외삽할 수 있다는 뜻이다. 앞선 연구에서는 이를 신뢰성 있게 해내지 못했다.

논문은 AI 출력의 무작위성을 조절하는 설정값인 생성 온도가 공격 성공률에 미치는 영향도 살펴본다. 저자들은 같은 네 개의 숫자를 이용해 실험하지 않은 온도에서의 성공률도 예측할 수 있다.

## AI 안전에 중요한 이유

모델의 예측이 실제로 들어맞는다면, 안전 엔지니어는 탈옥 가능성이 커지기 전에 공격자가 프롬프트를 몇 가지나 변형해야 하는지 추정할 수 있다. 이는 공개 API에서 허용할 프롬프트 횟수를 현실적으로 설정하거나 의심스러운 패턴을 얼마나 적극적으로 감시할지 결정하는 데 도움이 된다.

이 연구는 공격 성공률이 N에 따라 단순한 멱법칙을 따른다는 기존 주장에도 의문을 제기한다. 온도에 따라 달라지는 더 복잡한 곡선을 보여줌으로써, 방어책은 시도 횟수뿐 아니라 여러 요인을 고려해야 한다고 시사한다.

## 팩트

- 논문은 2026년 9월 29일 arXiv에 공개됐다.
- 마르코 비롤리는 이 연구의 단독 저자로 올라 있다.
- 이 모델은 안전 관련 매개변수 네 개만으로 서로 다른 언어 모델 다섯 종의 데이터를 맞춘다.
- 프롬프트 변형이 N ≤ 100인 공격 결과를 N = 10⁴인 경우까지 외삽할 수 있다.
- 저자들은 N에 따라 성공률 지수가 달라진다는 사실을 밝혀 단순한 멱법칙 가정에 반박한다.

## 왜 중요한가

이 모델은 AI 개발자가 공격자가 안전장치를 무너뜨리기 얼마나 어려운지 빠르게 가늠하도록 해 API 사용 제한과 모니터링 도구를 마련하는 데 도움을 준다. 또한 시도 횟수처럼 단일 지표에만 의존하면 탈옥을 더 쉽게 만드는 다른 요인을 놓칠 수 있다고 경고한다.

## 출처 및 참고 자료

1. [Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking](https://arxiv.org/abs/2609.32116) – arXiv, 2026-09-29

최종 업데이트: 2026-09-29
