「스크레이핑을 그만두고 스크린샷으로 검색한다」는 역발상의 RAG가 등장했다.
요약
UC Berkeley에서 개발한 PixelRAG는 웹 페이지와 PDF를 텍스트 추출 대신 스크린샷 형태로 임베딩하여 검색하는 새로운 RAG 방식입니다. HTML 구조 변화에 영향을 받지 않아 기존 스크레이핑 방식의 한계를 극복할 수 있습니다.
핵심 포인트
- 텍스트 추출 없이 이미지 상태 그대로 임베딩하여 검색 정확도 향상
- HTML 구조 변경 시에도 스크레이퍼 수정이 필요 없는 높은 유지보수성
- Qwen3-VL-Embedding과 FAISS를 활용한 효율적인 색인화
- Wikipedia 828만 페이지 규모의 호스팅된 색인 공개
「스크레이핑 (Scraping)을 그만두고 스크린샷으로 검색한다」는 역발상의 RAG가 등장했다.
UC Berkeley에서 개발한 PixelRAG.
・웹 페이지, PDF, 이미지를 타일 형태의 스크린샷으로 묘사
・Qwen3-VL-Embedding으로 이미지 상태 그대로 임베딩 (Embedding) 하여, FAISS로 색인화
・텍스트 추출을 거치지 않기 때문에, HTML 구조가 바뀌어도 망가지지 않음
・Wikipedia 828만 페이지의 호스팅된 색인도 공개되어 있음
논문 제목이 「Web Screenshots Beat Text for RAG」로, 텍스트 추출보다 이미지 상태 그대로인 편이 검색 정확도에서 승리한다는 주장.
스크레이퍼 (Scraper)가 HTML 변경 시마다 망가져서 수정해야 했던, 그 소모전에서 벗어날 수 있는 가능성이 있다.
Star 9.1k까지 늘어난 것도 납득이 갔다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @l_go_mrk (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기