Zhuchenyang Liu가 이끄는 연구팀은 2026년 10월 8일, 시각 문서 검색 시스템에 쓰이는 벡터 데이터베이스를 역으로 분석해 읽을 수 있는 페이지를 복원할 수 있다는 논문을 발표했다. 이 공격은 ViDoRe v3 벤치마크에서 단어의 약 47%를 복원하고, 질의의 98.4%에서 원본 페이지를 1위로 찾는다. 토큰 풀링이나 셔플링 같은 간단한 방어 기법을 적용하면 단어 복원율은 약 8%로 낮아지지만, 셔플된 벡터의 순서를 다시 맞추는 모델을 사용하면 여전히 93.5%의 확률로 올바른 페이지를 1위에 올릴 수 있다. 다른 검색기에서도 같은 문제가 확인됐으며, 원본 페이지가 70.2%의 확률로 1위에 올랐다.
왜 중요한가
문서 색인을 외부 업체의 벡터 데이터베이스에 저장하는 조직은 기밀 텍스트를 보호하기 위해 더 강력한 보안 조치를 마련해야 할 수 있다.