다중 벡터 시각 문서 인덱스 역변환 공격
요약
본 연구는 다중 벡터 시각 문서 검색기(retriever)가 저장된 패치 벡터 인덱스만으로도 원본 페이지를 재현할 수 있는 '역변환 공격'의 가능성을 제시합니다. ViDoRe v3 벤치마크에서 이 공격은 높은 복구율과 검색 정확도를 보였으며, 기존 보호 방법으로는 충분하지 않음을 입증했습니다.
핵심 포인트
- 다중 벡터 인덱스는 단순한 메타데이터가 아니며 재현 가능성이 높습니다.
- 역변환 공격을 통해 원본 페이지의 상당 부분(단어 47%, 민감 토큰 45%) 복구가 가능합니다.
- 토큰 풀링이나 셔플링 같은 기존 보호 방법은 이 공격에 효과적이지 않습니다.
- 다중 벡터 검색기는 인코딩하는 문서 자체를 보호해야 합니다.
현재의 다중 벡터 시각 문서 검색기(retriever)들은 각 페이지를 약 천 개의 패치 벡터로 저장하며, 이는 종종 제3자가 운영하는 벡터 데이터베이스에 보관됩니다. 아무도 이 벡터들만으로는 페이지 내용을 읽을 수 없다고 생각하기 때문에, 이 인덱스는 페이지 자체보다 덜 민감한 것으로 취급되는 경우가 많습니다. 하지만 이 인덱스가 패치별로 순서대로(raster order) 하나의 벡터를 유지하고, 각 벡터가 문서를 읽도록 사전 학습된 비전-언어 모델(vision-language model)에 의해 계산된다는 점을 고려할 때, 우리는 저장소 운영자나 침입자가 인덱스만으로도 페이지를 재현할 수 있다고 가정합니다. 우리는 역변환(inversion)을 조건부 문서 이미지 생성(conditional document image generation)으로 정의하고, 벡터들로부터 공격이 필요로 하는 것—즉, 인코더, 페이지 모양, 그리고 섞인 벡터들의 경우 그 순서—을 추론했습니다. ViDoRe v3 벤치마크에서 원시 인덱스(raw indices)로부터 역변환된 페이지는 원래 단어의 47%와 민감한 토큰의 45%를 복구했으며, 이를 저장된 인덱스를 대상으로 하는 쿼리로 사용했을 때 소스 페이지를 가장 높은 순위에 놓는 비율이 98.4%였습니다. 우리는 두 가지 간단한 보호 방법인 토큰 풀링(token pooling)과 셔플링(shuffling)을 테스트했는데, 이 둘 모두 단어 재현율(word recall)을 약 8%로 떨어뜨렸습니다. 섞인 인덱스의 순서를 복원하는 모델은 소스 페이지가 가장 높은 순위에 놓이는 비율을 3.8%에서 93.5%로 높였지만, 풀링된 인덱스를 역변환하는 것은 여전히 취약했습니다. 일반화 가능성을 테스트하기 위해, 우리는 동일한 공격을 다른 다중 벡터 검색기에도 적용했으며, 그 역변환된 페이지들은 소스 페이지를 가장 높은 순위에 놓는 비율이 70.2%였지만, 단어 재현율은 근접 이웃(nearest-neighbour) 기준선보다 낮게 유지되었습니다. 따라서 다중 벡터 시각 문서 검색기는 저장된 인덱스를 통해 역변환 공격에 취약하므로, 이는 인코딩하는 문서를 보호하는 것처럼 보호되어야 합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기