Cloudflare는 대규모 AI 모델이 자사의 웹 애플리케이션 방화벽(WAF)을 뚫으려는 실험을 진행했다. 모델은 방화벽이 이미 차단한 페이로드를 바탕으로 인코딩, 삽입 위치, 전달 방식을 바꿔 변형했다. 앞선 시도가 어떻게 처리됐는지도 다음 시도에 반영했다. 블랙박스 방식으로 진행돼 모델은 Cloudflare의 규칙이나 내부 신호를 볼 수 없었다.
테스트 결과
테스트는 Python 하네스가 조율했다. 하네스는 HTTP 요청을 만들고 상태를 유지하며, 제한을 적용하고 응답을 수집했다. AI는 다음 변형을 제안하고 결과를 평가했다. 45개 시나리오에서 총 1,107개의 변형 시도가 이뤄졌다. 사람이 검토한 결과 49건이 추가 조사가 필요하다고 판단됐고, 이 가운데 48건은 명령어 인젝션이나 서버 측 요청 위조(SSRF)와 관련된 것이었다. 이번 실험을 계기로 Cloudflare의 Managed Ruleset도 세 차례 업데이트됐다. SSRF – Obfuscated Host와 SSRF – Restricted Protocol 탐지 규칙을 새로 추가하고, 기존 SSRF – Cloud 규칙을 개선했다.
다른 보안 분야에서의 활용
Cloudflare의 방식은 다른 보안 중심 하네스와 비슷하다. Google의 Mandiant Agentic Vulnerability Discovery Harness는 코드 분석, 가설 생성, 검증을 맡는 전문 에이전트를 연결한다. OpenAI의 Codex Security와 Google의 PageBreak도 모델을 과정에 참여시키지만, 실행 범위를 엄격히 제한하고 수정 사항을 적용하기 전 사람이 검토하도록 한다.
왜 중요한가
Cloudflare를 이용하는 웹사이트 운영자에게는 이번 AI 기반 테스트로 이전에는 빠져나가던 교묘한 SSRF 공격 몇 가지를 방화벽이 추가로 차단하게 됐다는 의미가 있다. 자동화된 모델 기반 테스트가 내부 규칙을 공개하지 않고도 미묘한 공격 변형을 찾아낼 수 있음을 보여준다. 다만 최종 판단은 여전히 사람 분석가가 내리므로, 새로운 보호 기능이 적용되는 속도는 검토 역량에 따라 달라질 수 있다.