# 코딩 에이전트, AI 탐지 도구를 피하도록 텍스트 조합 가능

> 새로운 방식은 소형 언어 모델의 출력을 소프트웨어 에이전트가 조합해 탐지율을 77%에서 24%로 낮추지만, 질의 비용은 최대 30배까지 높일 수 있다.

Oossa · 2026-09-29 · https://oossa.com/ko/coding-agents-can-stitch-ai-text-to-dodge-detection-tools

연구진은 2026년 9월 25일, 코딩 에이전트가 기본 언어 모델의 텍스트를 조합해 AI 탐지 시스템을 피할 수 있다는 논문을 발표했다. Claude Opus 5를 기반으로 한 이 에이전트는 320억 개 매개변수의 모델 OLMo-2에서 단어의 최대 90%를 가져온다. 테스트에서 이렇게 조합한 응답은 두 종류의 탐지기를 피해 갔다. 사후 탐지 도구의 적중률은 77%에서 24%로 떨어졌고, 워터마크 기반 검사에서는 약 10%까지 낮아졌다.

## 작동 방식

이전의 우회 기법은 AI가 생성한 텍스트를 여러 차례 바꾸는 방식이었지만, 이 과정에서 의미가 달라지는 경우가 많았다. 이와 달리 이번 방식에서 에이전트는 복사해 붙여 넣는 편집자처럼 작동한다. 기본 모델에 짧은 샘플을 다수 요청한 뒤 창작, 사실 확인, 건강 관련 질문, 지시 따르기 등 과제에 가장 잘 맞는 부분을 고른다. 이 조각들을 이어 붙이면 최종 결과물은 주제를 벗어나지 않고 자연스럽게 읽히는 한편, 탐지기에는 연속된 하나의 AI 생성 문장이 아니라 여러 개의 짧은 조각이 섞인 것으로 보인다.

## 시사점과 비용

이 방법은 효과가 있지만 비용이 많이 든다. 에이전트가 텍스트의 기본 단위인 토큰을 훨씬 더 많이 주고받기 때문에, 질의당 비용이 일반적인 API 호출보다 최대 30배까지 높아질 수 있다. 연구진은 탐지 서비스가 효과를 유지하려면 이렇게 조합된 출력물로 학습해야 한다고 경고한다. 일반 사용자에게 이번 연구 결과는 AI 작성 콘텐츠를 찾아낸다고 내세우는 도구가 광고만큼 신뢰할 만하지 않을 수 있음을 뜻한다.

## 팩트

- 논문은 Bhuwan Dhingra가 2026년 9월 25일 제출했다.
- Claude Opus 5가 로컬에서 실행되는 320억 개 매개변수의 OLMo-2 모델을 조율했다.
- Pangram v4 탐지기의 탐지율은 77%에서 24%로 낮아졌다.
- 낮은 오탐율을 기준으로 할 때 소프트 워터마크 탐지율은 약 10%까지 떨어졌다.
- 에이전트가 훨씬 더 많은 토큰을 사용해 질의 비용이 최대 30배까지 오를 수 있다.

## 왜 중요한가

탐지 도구의 신뢰도가 떨어지면 텍스트가 사람이나 AI 중 누가 작성했는지 확인하기 어려워지고, 온라인 콘텐츠에 대한 신뢰에도 영향을 미칠 수 있다. 다만 우회 기법의 비용이 높아 대부분의 사용자가 가볍게 활용하기는 어려운 만큼, 진입 장벽은 여전히 높다.

## 출처 및 참고 자료

1. [Agents Can Use Base Models to Evade AI Detection](https://arxiv.org/abs/2609.31876) – arXiv, 2026-09-29

최종 업데이트: 2026-09-29
