OpenAI는 유럽연합 사용자를 대상으로 ChatGPT와 Codex 출력물에 textGrain이라는 비가시 워터마크를 적용한다. 회사는 생성된 텍스트에 기계가 읽을 수 있는 방식으로 표시할 수 있도록 하는 EU AI Act 요건을 충족하기 위해 앞으로 몇 주 안에 이 기능을 켤 예정이라고 밝혔다. OpenAI API를 사용하는 개발자는 워터마크를 자유롭게 켜거나 끌 수 있다. 이는 전 세계 Claude 출력물에 워터마크를 의무적으로 적용하는 Anthropic의 방식과 다르다.
워터마크 작동 방식과 한계
textGrain은 모델이 단어를 선택하는 방식에 통계적 패턴을 삽입한다. 이는 Anthropic의 Claude에 사용되는 Google의 SynthID와 비슷하다. OpenAI의 내부 테스트에 따르면 탐지기는 400-token(약 300단어) 분량의 심리학 글에서 약 95%의 확률로 패턴을 찾아내지만, 같은 길이의 수학 글에서는 약 60%만 탐지한다. 텍스트의 일부만 바꿔도 탐지율은 떨어진다. 단어의 10%를 동의어로 바꾸면 탐지율이 약 92%에서 66%로 낮아지고, 4분의 1을 바꾸면 약 17%까지 떨어진다.
탐지기 이용 방법
당분간 OpenAI는 신청 절차를 거쳐 선정된 연구자와 전문 기관에만 탐지기 이용을 허용한다. 이 도구는 OpenAI 워터마크가 있는지 여부만 알려줄 뿐, 누가 텍스트를 작성했는지 또는 어떤 프롬프트를 사용했는지는 공개하지 않는다.
왜 중요한가
EU 사용자의 ChatGPT 출력물에는 규제 당국이 읽을 수 있는 숨은 표시가 들어가 새 라벨링 규정 준수에 도움이 된다. 개발자는 이 표시를 숨길지 선택할 수 있어, 제3자가 AI 생성 텍스트를 알아보기 쉬운 정도에 영향을 줄 수 있다. 텍스트를 조금만 수정해도 탐지율이 낮아지므로, 사용자는 내용을 약간 바꿔 워터마크를 제거할 수도 있다.