ColPali, 문서 RAG를 위한 OCR 파이프라인 극복: 8배의 저장 비용과 0%의 청킹 (Chunking)
요약
ColPali는 문서 중심의 RAG 과정에서 번거로운 OCR 및 청킹 단계를 제거하기 위해 이미지 패치를 직접 벡터화하는 후기 상호작용(Late Interaction) 아키텍처를 제안합니다. ViDoRe 벤치마크에서 기존 SOTA를 능가하는 성능을 보여주지만, 페이지당 저장 비용이 기존 방식보다 약 8배 높다는 트레이드오프가 존재합니다.
핵심 포인트
- OCR, 청킹, 캡셔닝 과정 없이 이미지 패치를 직접 인코딩하여 문서 RAG 파이프라인을 단순화함
- 16×16 이미지 패치를 128차원 벡터로 인코딩하며, A4 한 페이지당 약 1,000개의 패치 벡터 생성
- ViDoRe 벤치마크의 다양한 문서 도메인에서 기존 SOTA 모델보다 뛰어난 성능 입증
- 멀티 벡터 표현 방식으로 인해 기존 바이-인코더(bi-encoder) 방식 대비 저장 비용이 8배 높음
- MaxSim 메커니즘을 활용한 후기 상호작용(Late Interaction) 검색 방식 채택
ColPali는 각 16×16 이미지 패치 (image patch)를 128차원 벡터로 인코딩함으로써 문서 중심의 RAG (Retrieval-Augmented Generation)에서 OCR 및 청킹 (chunking) 과정을 제거합니다. 이는 ViDoRe 벤치마크에서 기존의 SOTA (State-of-the-Art)를 능가하지만, 페이지당 저장 비용은 8배 더 높습니다. ColPali는 후기 상호작용 검색 아키텍처 (late-interaction retrieval architecture)로, PDF 페이지의 각 16×16 이미지 패치를 128차원 벡터로 인코딩하여 문서 중심의 RAG를 위한 OCR 및 청킹을 제거합니다. ViDoRe 벤치마크에서 대부분의 문서 도메인에 걸쳐 기존 SOTA 시스템보다 뛰어난 성능을 보이지만, 페이지당 저장 비용은 8배 더 많이 소모됩니다.
주요 사실
- ColPali는 각 16×16 이미지 패치를 128차원 벡터로 인코딩합니다.
- 전체 A4 페이지는 약 1,000개의 패치 벡터를 생성합니다.
- ViDoRe 벤치마크: ColPali는 대부분의 문서 도메인에서 기존 SOTA를 능가합니다.
- 저장 비용은 바이-인코더 (bi-encoder) 설정보다 대략 8배 더 높습니다.
- OCR, 청킹 (chunking), 또는 캡셔닝 (captioning) 단계가 필요하지 않습니다.
핵심 요약
ColPali는 각 16×16 이미지 패치를 128차원 벡터로 인코딩함으로써 문서 중심의 RAG에서 OCR 및 청킹을 제거합니다. ViDoRe 벤치마크에서 기존 SOTA를 능가하지만, 페이지당 저장 비용은 8배 더 높습니다.
멀티모달 RAG의 세 가지 패턴
텍스트 전용 RAG는 기업 데이터에서 실패합니다: 표는 깨진 텍스트가 되고, 차트는 사라지며, 스캔된 송장은 직인과 필기 내용을 잃어버립니다. [멀티모달 RAG 기사에 따르면] 세 가지 아키텍처 패턴이 있으며, 각 패턴은 뚜렷한 트레이드오프 (tradeoffs)를 가집니다.
패턴 1: 추출 후 임베딩 (Extract-then-Embed, Late Fusion)
이것은 현재 가장 널리 배포된 패턴입니다. 각 모달리티 (modality)를 전문 추출기를 통해 처리합니다. 예를 들어 이미지 캡션에는 GPT-4V를, 오디오에는 Whisper를 사용한 다음
패턴 2: 네이티브 멀티모달 임베딩 (Native Multimodal Embedding, Early Fusion) CLIP (512-dim) 또는 Meta의 ImageBind (6개 모달리티)와 같은 교차 모달 인코더 (cross-modal encoder)를 사용하여 각 모달리티를 공유 벡터 공간 (shared vector space)에 직접 임베딩합니다. 캡셔닝 (captioning) 단계가 없으므로 데이터 수집 (ingestion) 속도가 더 빠릅니다. 하지만 CLIP의 512-dim 임베딩은 복잡한 시각적 추론 (visual reasoning)을 수행하기에는 용량이 부족합니다. 미세 조정 (fine-tuning)을 거치지 않으면 기술 도표나 과학적 그래프에서 성능이 저하됩니다. 제품 카탈로그나 의료 스캔과 같이 이미지가 많은 코퍼스 (corpora)에 적합합니다.
패턴 3: ColPali / 후기 상호작용 (Late Interaction) — 문서 처리를 위한 현재 최선의 방법
ColPali는 문서 페이지의 각 16×16 이미지 패치 (patch)를 자체 벡터로 인코딩하여 페이지당 멀티 벡터 표현 (multi-vector representation)을 생성합니다. A4 용지 한 페이지는 약 1,000개의 패치 벡터를 생성합니다. 쿼리 시점에는 MaxSim 후기 상호작용 메커니즘 (ColBERT에서 차용)을 사용하여 모든 패치-쿼리 토큰 쌍 간의 최대 유사도를 계산합니다. CLIP과의 결정적인 차이점은 페이지당 하나의 벡터를 얻는 대신, 16×16 이미지 패치당 하나의 벡터를 얻는다는 것입니다.
데이터 수집 파이프라인 (Ingestion pipeline): PDF 페이지를 스크린샷으로 찍고 (pdf2image 사용), PaliGemma-3B VLM을 통과시켜 패치 그리드 임베딩 [n_patches × 128-dim]을 얻은 다음, 멀티 벡터 인덱스 (PLAID 또는 멀티 벡터를 지원하는 Qdrant)에 저장합니다. OCR, 청킹 (chunking), 캡셔닝 (captioning)이 전혀 필요 없습니다. VLM은 표 테두리, 글꼴 크기, 열 레이아웃, 삽입된 그림 등 실제 렌더링된 페이지를 직접 봅니다.
장점: 법률 계약서, 의료 양식, 차트가 포함된 재무 보고서와 같이 레이아웃이 복잡한 문서에서 OCR 기반 파이프라인보다 압도적으로 뛰어난 성능을 보입니다. ViDoRe 벤치마크에 따르면 ColPali는 대부분의 문서 도메인에서 이전의 SOTA (State-of-the-Art) 검색 시스템들을 능가합니다. 데이터 수집 파이프라인이 획기적으로 단순해지며, OCR 기반 파이프라인에서
쿼리당 지연 시간(Query latency)은 더 높지만, 수십만 페이지 미만의 코퍼스(Corpus) 규모에서는 오버헤드가 밀리초(ms) 단위에 불과합니다. 사용 시점: 법률, 금융, 의료와 같이 문서 비중이 높은 기업용 유스케이스(Use cases). 레이아웃, 표, 차트, 타이포그래피가 의미론적 의미(Semantic meaning)를 갖는 모든 코퍼스. 자연 이미지 검색(이 경우 CLIP이 더 나음)이나 순수 텍스트 코퍼스(표준 텍스트 RAG가 더 나음)에는 적합하지 않습니다. 오디오 — 아무도 제대로 다루지 못하는 모달리티(Modality): 두 가지 접근 방식이 존재합니다. 전사 우선 방식(Transcription-first, Whisper large-v3 → 텍스트 RAG) 또는 네이티브 오디오 임베딩(Native audio embeddings, ImageBind, CLAP). 전사(Transcription)는 손실이 발생합니다 — 준언어적 정보(Paralinguistic information)가 사라지기 때문입니다. 네이티브 임베딩은 어조와 강조를 보존하지만, 도메인 특화 오디오에 대한 미세 조정(Fine-tuning)이 필요합니다. 독특한 관점: ColPali는 구조적 변화를 나타냅니다. 이는 문서 페이지를 텍스트가 아닌 이미지로 취급합니다. 이는 텍스트 추출이 검색보다 선행되어야 한다는 전통적인 RAG의 가정을 뒤집는 것입니다. 레이아웃이 의미를 갖는 기업용 워크로드(Legal contracts, Financial reports)에서 ColPali의 패치 수준(Patch-level) 접근 방식은 8배의 저장 공간 오버헤드에도 불구하고 유의미하게 우월합니다. 트레이드오프(Tradeoff)는 명확합니다: 취약한 OCR/청킹(Chunking) 파이프라인을 완전히 제거하기 위해 저장 비용 8배를 지불하는 것입니다. 주목할 점: 향후 6개월 동안 법률 및 금융 문서 검색 시스템에서 ColPali의 기업 도입 여부를 지켜보십시오. 핵심 지표: PLAID 방식의 압축 인덱스(Compressed indices)를 통해 멀티 벡터(Multi-vector) 저장 비용이 낮아지는지, 그리고 Qdrant나 Pinecone이 네이티브 멀티 벡터 지원을 추가하는지 여부입니다. 원문은 gentic.news에 게시되었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기