Xberg v1 출시
요약
콘텐츠 인텔리전스 프레임워크인 Xberg v1이 출시되었습니다. 다양한 문서, 코드, 오디오, 비디오 형식을 처리하며 고성능 PDF 추출 및 OCR 엔진을 제공합니다.
핵심 포인트
- Pure-Rust PDF 백엔드 및 레이아웃 인식 파이프라인 지원
- 다양한 OCR 엔진(PaddleOCR, Candle OCR 등) 및 WASM 기반 추론 가능
- 구조화된 LLM 추출 및 오디오/비디오 전사 기능 포함
- 임베딩 및 재순위화를 포함한 검색 빌딩 블록 제공
안녕하세요 여러분, Xberg v1이 출시되었음을 기쁘게 발표합니다. Xberg는 Kreuzberg의 후속작으로, Kreuzberg v5에 해당하는 모델입니다. 이는 매우 광범위한 입력을 처리하는 콘텐츠 인텔리전스 프레임워크 (content intelligence framework)입니다: 문서 (현재 101개 형식), 코드 및 데이터 형식 (현재 367개 유형), 오디오/비디오 전사 (transcription), 그리고 URL (정적 및 JS 렌더링 콘텐츠 모두 포함)을 처리합니다. 이 프레임워크는 해당 콘텐츠를 추출하여 다운스트림 프로세싱 (downstream processing)을 위해 준비합니다. 이는 매우 효율적이고 고성능인 엔진입니다 (아래의 PDF 벤치마크를 참조하세요). 특히 PDF와 이미지의 경우, 매우 높은 성능과 정확도로 네이티브 PDF를 처리하며, 최고의 Python 라이브러리(예: docling, PaddleOCR, RapidOCR)와 대등한 품질을 제공하면서도 실질적으로 훨씬 더 나은 성능과 안정성을 갖춘 여러 OCR 엔진을 제공합니다. Kreuzberg v4와 Xberg v1 사이의 변경 사항은 상당하며, 전체적인 내용을 파악하기 위해 전체 변경 로그 (changelog)를 읽어보시길 권장합니다. 아래의 주요 하이라이트는 새로운 기능에 대한 감을 제공합니다:
- Pure-Rust PDF 백엔드 (pdf_oxide)가 pdfium을 대체하여, 네이티브 pdfium 의존성 없이 작동합니다.
- 레이아웃 인식 파이프라인 (Layout-aware pipeline): ONNX 레이아웃 탐지 (PP-DocLayoutV3 / RT-DETR) 및 Docling 스타일의 선행자 그래프 (predecessor-graph) 재정렬을 통해 읽기 순서를 재구성합니다.
- 선택적 OCR을 포함한 페이지별 스캔 페이지 탐지, 그리고 AcroForm/XFA 양식 필드 및 아웃라인 기반 헤딩 (outline-based headings) 지원.
- OCR 및 PDF 추출의 전반적인 최적화 (메모리 관리, 풀링된 모델 세션, 스트리밍 변환).
- Tesseract와 함께 네이티브 PaddleOCR 백엔드 (중형 / 소형 / 초소형 티어의 PP-OCRv6) 제공.
- ONNX Runtime이나 네이티브 Tesseract 없이 실행되는 Pure-Rust Candle OCR/VLM 스택 (TrOCR, GLM-OCR, GOT-OCR, DeepSeek-OCR, 그리고 PaddleOCR-VL).
- tract를 통한 두 번째 ONNX-Runtime-free 추론 경로를 제공하며, 이를 통해 브라우저 내 (WASM) 및 모바일 추론이 가능해집니다.
- Rust에서 네이티브로 구현된 개체명 인식 (Named-entity recognition, GLiNER2)으로, 서버 왕복(round-trip) 없이 브라우저 내 WASM 모델을 포함한 모든 바인딩으로 확장 가능합니다.
래스터화 (rasterization), 청킹 (chunking), 인용 (citations), 캐싱 (caching), 그리고 설정 가능한 호출/병합/VLM-폴백 (call/merge/VLM-fallback) 정책을 포함한 구조화된 LLM 추출 (extract_structured / split_and_extract) 기능을 제공합니다. Whisper ONNX 엔진을 통한 오디오 및 비디오 전사 (.mp3, .wav, .m4a, .mp4, .webm)를 지원합니다. 검색 빌딩 블록 (Retrieval building blocks): 밀집 임베딩 (dense embeddings)과 더불어 희소 임베딩 (sparse embeddings, SPLADE), ColBERT 후기 상호작용 검색 (late-interaction retrieval), 그리고 교차 인코더 재순위화 (cross-encoder reranking)를 지원합니다. 텍스트 지능 (Text intelligence): 가역적 비식별화 (reversible redaction), 요약 (summarization), 번역 (translation), VLM 이미지 캡셔닝 (image captioning), QR 코드 탐지 (QR-code detection), 문서 차이 분석 (document diffing), 그리고 페이지/청크 분류 (page/chunk classification) 기능을 제공합니다. URL 및 웹 수집 (URL & web ingestion): 사이트맵 발견 (sitemap discovery, map_url) 및 배치 방식의 멀티 URL 크롤링을 지원합니다. 새로운 문서 형식: WordPerfect (.wpd / .wp / .wp5), HEIC/HEIF/AVIF, OpenDocument Presentation (.odp), Quarto / R Markdown, 그리고 설정 가능한 Jupyter 셀 렌더링을 지원합니다. 4개의 새로운 언어 바인딩 (Dart/Flutter, Swift, Kotlin/Android, Zig)이 추가되어, 하나의 엔진에 대해 총 15개의 언어 바인딩을 제공하며, Android/iOS 교차 컴파일 (cross-compilation)이 가능합니다. 완전한 모바일 지원 (Flutter, Android, iOS)을 제공합니다. ONNX와 함께 Candle 백엔드를 지원하며, ONNX-via-tract를 통해 WASM 및 Android에서 ONNX를 사용할 수 있습니다. 더 넓은 코드 지능 (code intelligence): tree-sitter 지원 범위가 대폭 확장되었습니다 (248개에서 367개 이상의 언어로 증가). 1.0 사이클 동안 150개 이상의 버그를 수정하였으며, 보안 강화 (제한된 RTF/PDF 할당, 비식별화 유출 수정, Excel DDE 경고)를 수행했습니다. API 표면 (API surface) 또한 단순화 및 재작업되어 더욱 일관성 있게 개선되었습니다. Kreuzberg에서 Xberg로 전환하는 방법을 설명하는 마이그레이션 가이드가 문서에 포함되어 있습니다. Kreuzberg 자체는 올해 말까지 LTS (Long Term Support) 모드로 유지되며, 버그 수정 및 보안 업데이트를 계속 제공할 예정입니다. 저장소(repo)를 확인하고 저희 Discord 서버에 참여해 주세요. 벤치마크: 아래의 벤치마크는 PDF와 이미지에 대해서만 해당됩니다. 포맷별 세부 분석을 포함한 광범위한 벤치마크는 저희 웹사이트에서 확인하실 수 있으며, 여기에서 보실 수 있습니다.
이 수치들은 저희의 재현 가능한 벤치마크 하네스 (benchmark harness)를 통해 CI (지속적 통합)에서 측정되었으며, 특히 harness 1.0.8, 소스 cf7fa0533d 실행 결과에서 추출되었습니다. 데이터는 GitHub releases에서 공개적으로 확인할 수 있으며, 직접 벤치마크 하네스를 실행해 보실 수도 있습니다.
종합 품질 (markdown 파이프라인, 높을수록 좋음):
| 프레임워크 | Native PDF | Scanned PDF (OCR) |
|---|---|---|
| Xberg (layout) | 0.958 | 0.836 |
| Xberg (baseline) | 0.955 | 0.687 |
| docling | 0.779 | 0.762 |
| mineru | 0.408 | 0.792 |
| liteparse | 0.837 | 0.665 |
| markitdown | 0.689 | n/a |
| pymupdf4llm | 0.448 | n/a |
구조 및 레이아웃 충실도 (SF1: 표 및 읽기 순서, 높을수록 좋음):
| 프레임워크 | Native PDF | Scanned PDF |
|---|---|---|
| Xberg | 0.949 | 0.531 |
| docling | 0.612 | 0.366 |
| liteparse | 0.515 | 0.142 |
| mineru | 0.077 | 0.429 |
Native PDF의 경우, Xberg는 품질(0.958 vs 차순위 프레임워크 0.837)과 표 및 읽기 순서 충실도(SF1 0.949 vs docling 0.612) 모두에서 앞서 나갑니다. Scanned PDF의 경우, 품질과 원문 텍스트 충실도 모두에서 1위를 차지했습니다.
아직 승리하지 못한 부분: 순수 이미지 OCR 분야에서는 현재 종합 점수에서 mineru에 이어 2위를 기록하고 있습니다 (단, 원문 텍스트 정확도에서는 여전히 1위입니다). 현재 이미지 OCR을 개선하고 있으며, v1.1에서는 모든 분야에서 승리할 수 있을 것입니다.
제출자: /u/Goldziher [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기