🚨웹 스크래핑의 시대는 끝났다🚨
요약
PixelRAG는 HTML 파싱 대신 스크린샷을 활용하여 웹사이트를 시각적으로 인덱싱하는 오픈 소스 시스템입니다. 기존 텍스트 기반 RAG보다 높은 성능을 보이며, Claude Code 플러그인을 통해 시각적 정보를 직접 처리할 수 있습니다.
핵심 포인트
- HTML 파싱 없이 스크린샷과 시각-언어 모델을 활용
- 표, 차트, 레이아웃 등 시각적 요소 손실 방지
- 텍스트 기반 RAG 대비 QA 성능 18.1% 향상
- Qwen3-VL-Embedding과 FAISS를 이용한 픽셀 기반 검색
- Apache-2.0 라이선스의 오픈 소스 프로젝트
🚨웹 스크래핑 (Web Scraping)의 시대는 끝났다🚨
그들이 PixelRAG를 만들어냈습니다.
HTML 파싱 (Parsing)을 건너뛰는 오픈 소스 (Open source) 시스템입니다.
웹사이트를 텍스트로 변환하는 대신...
⚠️ it takes a screenshot.
스크린샷을 찍습니다.
그러고 나서 시각-언어 모델 (Vision-language model)이 픽셀 (Pixels)로부터 직접 응답을 읽어냅니다.
엄청납니다.
기존의 스크래핑 (Scraping)은 수많은 정보를 망가뜨리기 때문입니다:
→ 표 (Tables)
→ 차트 (Charts)
→ 레이아웃 (Layouts)
→ 열 (Columns)
→ 버튼 (Buttons)
→ PDF
→ 구조가 불량한 페이지들
웹사이트를 일반 텍스트로 변환할 때 이 모든 것들이 손실됩니다.
PixelRAG는 훨씬 더 단순한 방식을 사용합니다:
사람이 보는 그대로 페이지를 인덱싱 (Indexing)합니다.
팀은 위키피디아 (Wikipedia)의 전체 시각적 인덱스를 구축했습니다:
+3,000만 개의 스크린샷.
그리고 질의응답 (QA)에서 최고의 텍스트 기반 RAG (Retrieval-Augmented Generation)보다 18.1% 더 높은 성능을 보였습니다.
또한 Claude Code를 위한 플러그인 (Plugin)도 갖추고 있습니다.
기본적으로 Claude에게 눈을 달아주는 격입니다.
URL, arXiv 논문, 또는 로컬 웹사이트를 전달하면...
Claude는 DOM을 스크래핑하지 않습니다.
그냥 그것을 바라봅니다.
작동 방식:
→ 웹사이트, PDF, 이미지를 타일 (Tiles)로 렌더링 (Rendering)
→ Qwen3-VL-Embedding으로 임베딩 (Embedding)
→ FAISS 인덱스 구축
→ 픽셀 위에서 시각적으로 검색
모두 Apache-2.0 라이선스 하의 오픈 소스입니다.
리포지토리 (Repo) 링크는 댓글에 있습니다 👇🏻
AI 자동 생성 콘텐츠
본 콘텐츠는 X @nainsidwiv50980 (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기