· 1 분 읽기
코딩 에이전트, AI 탐지 도구를 피하도록 텍스트 조합 가능
새로운 방식은 소형 언어 모델의 출력을 소프트웨어 에이전트가 조합해 탐지율을 77%에서 24%로 낮추지만, 질의 비용은 최대 30배까지 높일 수 있다.
Oossa · Oossa 소개
연구진은 2026년 9월 25일, 코딩 에이전트가 기본 언어 모델의 텍스트를 조합해 AI 탐지 시스템을 피할 수 있다는 논문을 발표했다. Claude Opus 5를 기반으로 한 이 에이전트는 320억 개 매개변수의 모델 OLMo-2에서 단어의 최대 90%를 가져온다. 테스트에서 이렇게 조합한 응답은 두 종류의 탐지기를 피해 갔다. 사후 탐지 도구의 적중률은 77%에서 24%로 떨어졌고, 워터마크 기반 검사에서는 약 10%까지 낮아졌다.
작동 방식
이전의 우회 기법은 AI가 생성한 텍스트를 여러 차례 바꾸는 방식이었지만, 이 과정에서 의미가 달라지는 경우가 많았다. 이와 달리 이번 방식에서 에이전트는 복사해 붙여 넣는 편집자처럼 작동한다. 기본 모델에 짧은 샘플을 다수 요청한 뒤 창작, 사실 확인, 건강 관련 질문, 지시 따르기 등 과제에 가장 잘 맞는 부분을 고른다. 이 조각들을 이어 붙이면 최종 결과물은 주제를 벗어나지 않고 자연스럽게 읽히는 한편, 탐지기에는 연속된 하나의 AI 생성 문장이 아니라 여러 개의 짧은 조각이 섞인 것으로 보인다.
시사점과 비용
이 방법은 효과가 있지만 비용이 많이 든다. 에이전트가 텍스트의 기본 단위인 토큰을 훨씬 더 많이 주고받기 때문에, 질의당 비용이 일반적인 API 호출보다 최대 30배까지 높아질 수 있다. 연구진은 탐지 서비스가 효과를 유지하려면 이렇게 조합된 출력물로 학습해야 한다고 경고한다. 일반 사용자에게 이번 연구 결과는 AI 작성 콘텐츠를 찾아낸다고 내세우는 도구가 광고만큼 신뢰할 만하지 않을 수 있음을 뜻한다.
왜 중요한가
탐지 도구의 신뢰도가 떨어지면 텍스트가 사람이나 AI 중 누가 작성했는지 확인하기 어려워지고, 온라인 콘텐츠에 대한 신뢰에도 영향을 미칠 수 있다. 다만 우회 기법의 비용이 높아 대부분의 사용자가 가볍게 활용하기는 어려운 만큼, 진입 장벽은 여전히 높다.
출처 및 참고 자료
| # | 출처 | 매체 | 날짜 | 핵심 내용 |
|---|---|---|---|---|
| 1 | Agents Can Use Base Models to Evade AI Detection ↗ | arXiv | 2026. 9. 29. | arXiv:2609.31876v1 Announce Type: new Abstract: We show that coding agents equipped with a base language model can successfully assemble res |
1 개 출처
최종 업데이트:
Oossa · 뉴스레터
이번 주 AI, 쉽게 정리
매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.