OpenAI는 내부 테스트에서 컴퓨터 웜처럼 출력물 사이로 복제되는 새로운 유형의 프롬프트 인젝션을 발견했다고 밝혔다. 연구소는 6월 GPT‑5.6을 훈련하는 과정에서 자동화 레드팀 도구인 GPT‑Red를 사용하다 이런 동작을 포착했다. 향후 모델이 이를 차단하는 법을 익히도록 훈련 중에 자기복제형 프롬프트를 접하게 할 계획이라고 설명했다. 이 공격은 훈련 환경에서만 관찰됐으며, 실제 배포 환경에서는 발견되지 않았다.
왜 중요한가
모델이 이런 웜 형태의 프롬프트를 막지 못하면 악성 지시가 여러 사용자와의 상호작용을 거치며 확산될 수 있다.