OossaAI는 빠르게 발전하고 있습니다. 저희가 쉽게 설명해 드립니다.
뉴스레터

· 1 분 읽기

새 모델, 노력에 따라 AI 탈옥 공격이 어떻게 늘어나는지 예측

마르코 비롤리가 이끄는 연구진은 2026년 9월 29일, 공격자가 프롬프트를 더 많이 시도할수록 탈옥 성공률이 얼마나 높아지는지 추정하는 간단한 공식을 제시한 논문을 공개했다.

Oossa · Oossa 소개

새 모델, 노력에 따라 AI 탈옥 공격이 어떻게 늘어나는지 예측
Photo by FlyD on Unsplash

컴퓨터 과학자 마르코 비롤리는 2026년 9월 29일 arXiv에 「정렬에서 벗어나기: Best-of-N 탈옥의 물리적 장벽 모델」이라는 논문을 올렸다. 이 연구는 공격자가 두 가지 변수, 즉 프롬프트 변형의 수(N)와 변형 하나당 응답 수(M)를 늘릴 때 탈옥 공격의 성공률이 어떻게 달라지는지 설명하는 간단한 ‘장벽 모델’을 제시한다. 이 모델은 안전장치와 관련된 숫자 네 개만 사용하지만, 지금까지 시험된 것보다 훨씬 큰 규모의 공격 결과도 예측할 수 있다.

새 모델은 어떤 역할을 하나?

이 모델은 각 프롬프트에 기본 안전 수준이 있다고 본 뒤, 공격자가 충분히 다양한 시도를 하면 넘을 수 있는 무작위 ‘장벽’을 더한다. 저자들은 서로 다른 언어 모델 다섯 종의 데이터에 네 개의 숫자를 맞춰, 다섯 모델 모두가 같은 스케일링 곡선에 들어맞는다는 것을 보였다. 이는 프롬프트 변형을 최대 100개까지 사용한 실험 결과를 변형 10,000개를 쓰는 상황까지 외삽할 수 있다는 뜻이다. 앞선 연구에서는 이를 신뢰성 있게 해내지 못했다.

논문은 AI 출력의 무작위성을 조절하는 설정값인 생성 온도가 공격 성공률에 미치는 영향도 살펴본다. 저자들은 같은 네 개의 숫자를 이용해 실험하지 않은 온도에서의 성공률도 예측할 수 있다.

AI 안전에 중요한 이유

모델의 예측이 실제로 들어맞는다면, 안전 엔지니어는 탈옥 가능성이 커지기 전에 공격자가 프롬프트를 몇 가지나 변형해야 하는지 추정할 수 있다. 이는 공개 API에서 허용할 프롬프트 횟수를 현실적으로 설정하거나 의심스러운 패턴을 얼마나 적극적으로 감시할지 결정하는 데 도움이 된다.

이 연구는 공격 성공률이 N에 따라 단순한 멱법칙을 따른다는 기존 주장에도 의문을 제기한다. 온도에 따라 달라지는 더 복잡한 곡선을 보여줌으로써, 방어책은 시도 횟수뿐 아니라 여러 요인을 고려해야 한다고 시사한다.

왜 중요한가

이 모델은 AI 개발자가 공격자가 안전장치를 무너뜨리기 얼마나 어려운지 빠르게 가늠하도록 해 API 사용 제한과 모니터링 도구를 마련하는 데 도움을 준다. 또한 시도 횟수처럼 단일 지표에만 의존하면 탈옥을 더 쉽게 만드는 다른 요인을 놓칠 수 있다고 경고한다.

이 기사가 도움이 되었나요?

출처 및 참고 자료

#출처매체날짜핵심 내용
1Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking ↗arXiv2026. 9. 29.arXiv:2609.32116v1 Announce Type: new Abstract: Best-of-$N$ jailbreaking (BoN) bypasses safeguards of aligned models by drawing $N$ independ

1 개 출처

최종 업데이트:

Oossallms.txt.md

공유

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.

새 모델, 노력에 따라 AI 탈옥 공격이 어떻게 늘어나는지 예측 – Oossa