# 벡터만으로 문서 색인을 복원할 수 있다는 연구 결과

> 연구진은 다중 벡터 기반 시각 문서 색인에 페이지를 재구성할 만큼의 정보가 담겨 있어 민감한 텍스트가 노출될 수 있다고 밝혔다.

Oossa · 2026-10-08 · https://oossa.com/ko/study-shows-document-indexes-can-be-recreated-from-vectors

Zhuchenyang Liu가 이끄는 연구팀은 2026년 10월 8일, 시각 문서 검색 시스템에 쓰이는 벡터 데이터베이스를 역으로 분석해 읽을 수 있는 페이지를 복원할 수 있다는 논문을 발표했다. 이 공격은 ViDoRe v3 벤치마크에서 단어의 약 47%를 복원하고, 질의의 98.4%에서 원본 페이지를 1위로 찾는다. 토큰 풀링이나 셔플링 같은 간단한 방어 기법을 적용하면 단어 복원율은 약 8%로 낮아지지만, 셔플된 벡터의 순서를 다시 맞추는 모델을 사용하면 여전히 93.5%의 확률로 올바른 페이지를 1위에 올릴 수 있다. 다른 검색기에서도 같은 문제가 확인됐으며, 원본 페이지가 70.2%의 확률로 1위에 올랐다.

## 팩트

- 논문 발표일: 2026-10-08
- 역분석으로 단어의 47%를 복원하고 원본 페이지를 98.4%의 확률로 1위에 올림

## 왜 중요한가

문서 색인을 외부 업체의 벡터 데이터베이스에 저장하는 조직은 기밀 텍스트를 보호하기 위해 더 강력한 보안 조치를 마련해야 할 수 있다.

## 출처 및 참고 자료

1. [Inverting Multi-Vector Visual Document Indices](https://arxiv.org/abs/2610.09920) – arXiv cs.IR, 2026-10-08

최종 업데이트: 2026-10-08
