Anthropic 내부 레드팀은 2026년 9월 29일 자사 Frontier 테스트 결과를 공개했다. 레드팀은 최신 모델 두 종인 GLM‑5.3과 Claude Mythos Preview를 대상으로 무작위 바이너리 익스플로잇 과제 100개를 수행했다. GLM‑5.3은 시도한 과제의 4%에서 코드 실행 흐름을 완전히 탈취했고, Claude Mythos Preview의 성공률은 6%였다. Claude Opus 4.6과 GLM‑5.2 등 이전 모델은 같은 테스트에서 한 번도 탈취에 성공하지 못했다.
수치가 의미하는 것
코드 실행 흐름 탈취란 프로그램이 공격자가 선택한 코드를 실행하도록 속이는 것이다. 보안 분야에서 시스템을 장악하는 대표적인 수법이다. 몇 차례의 시험에서나마 이들 모델이 이런 공격 코드를 만들어냈다는 것은 실행 가능한 공격 페이로드를 생성할 만큼 저수준 코드에 대한 이해를 습득했음을 보여준다. 레드팀은 자사 모델이 이 수준에 도달한 것은 이번이 처음이라고 밝혔다.
일반 사용자에게 중요한 이유
대부분의 사람은 바이너리 익스플로잇 테스트를 접할 일이 없겠지만, 이번 결과는 향후 AI 비서가 악용될 경우 더 강력하고 잠재적으로 해로운 스크립트를 작성할 수 있음을 시사한다. 보안팀도 AI가 생성한 코드를 사람이 작성한 코드와 마찬가지로 신중하게 다뤄야 한다. 아직 이런 역량은 제한적이며 몇 퍼센트의 사례에서만 나타나지만, 안전성 연구가 새롭게 필요한 영역임을 보여준다.
왜 중요한가
이번 결과는 최신 언어 모델이 실제로 프로그램을 장악하는 코드를 생성할 수 있음을 보여준다. 이는 Anthropic 모델에서 전에 관찰되지 않았던 역량이다. 성공률은 여전히 낮지만, AI 도구로 소프트웨어를 작성하거나 검토할 때 더 강력한 안전장치가 필요하다는 점을 시사한다.