
nvidia/NVIDIA-Nemotron-Parse-2.0 · Hugging Face
요약
NVIDIA가 문서 이미지를 구조화된 텍스트와 레이아웃 정보로 변환하는 Nemotron Parse 2.0 모델을 공개했습니다. 차트 인식 기능과 다국어 지원이 강화되었으며, RAG 및 데이터 추출 워크플로우에 최적화되어 있습니다.
핵심 포인트
- 문서 이미지에서 텍스트, 레이아웃, 경계 상자, 읽기 순서 추출
- 차트 인식 및 차트-to-표 파싱 기능 강화
- CJK 및 인도 계열 문자를 포함한 다국어 OCR 성능 향상
- RAG, 데이터 추출, 에이전트형 AI 구축을 위한 구조화된 출력 제공
NVIDIA Nemotron Parse 2.0은 문서 이미지를 텍스트, 레이아웃 클래스 (layout classes), 경계 상자 (bounding boxes), 그리고 읽기 순서 (reading-order) 정보가 포함된 구조화되고 기계가 읽을 수 있는 표현으로 변환합니다. Red, Green, Blue (RGB) 문서 이미지와 작업 프롬프트 (task prompt)가 주어지면, 이 모델은 제목, 단락, 캡션, 표, 차트, 페이지 헤더, 페이지 푸터, 각주, 사진, 참고 문헌 항목과 같은 문서 요소에 대한 형식화된 텍스트와 공간 주석 (spatial annotations)을 생성합니다. NVIDIA Nemotron Parse v1.2와 비교하여, NVIDIA Nemotron Parse 2.0은 더 효율적인 다국어 지원을 위해 약 20k-토큰 어휘 확장을 추가하였고, <class_Chart> 클래스 토큰을 통한 차트 인식 문서 파싱 (chart-aware document parsing), 그리고 차트/표가 많은 문서에 대한 업데이트된 학습 범위를 제공합니다. NVIDIA Nemotron Parse 2.0은 문서 이해 (document understanding), 정보 검색 (information retrieval), 데이터 추출 (data extraction), 그리고 멀티모달 데이터 큐레이션 (multimodal data-curation) 워크플로우를 위해 설계되었습니다. 이 모델은 상업적 또는 비상업적 용도로 사용할 수 있습니다.
사용 사례 (Use Case): NVIDIA Nemotron Parse 2.0은 문서 지능 (document intelligence), 검색 증강 생성 (RAG), 큐레이터 (curator), 추출기 (extractor), 그리고 에이전트형 AI (agentic AI) 애플리케이션을 구축하는 개발자와 팀을 위해 설계되었습니다. 스캔되었거나 렌더링된 PDF, 프레젠테이션 슬라이드, 양식, 보고서, 표, 그리고 혼합 콘텐츠 문서 페이지를 다운스트림 인덱싱 (downstream indexing), 검색 (retrieval), 분석 (analytics), 모델 학습 데이터 생성, 그리고 인간 참여형 검토 (human-in-the-loop review)를 위한 구조화된 출력으로 변환하는 데 사용할 수 있습니다.
주요 기능 하이라이트 (Capability Highlights): CJK(한중일) 및 인도 계열 문자 (Indic-script) 문서 텍스트에서 상당한 성능 향상을 보인 확장된 다국어 OCR 지원. 비정형, 필기체 또는 메모 형태의 콘텐츠를 포함하는 문서 페이지에 대한 개선된 필기 텍스트 추출 (handwritten-text extraction). 차트 영역을 식별하고 가시적인 차트 정보를 다운스트림 용도의 구조화된 텍스트로 변환할 수 있는 차트-to-표 파싱 (Chart-to-table parsing). 표가 많은 문서에 대한 더 강력한 표 탐지 (table detection), 구조 복구 (structure recovery), 그리고 텍스트 추출을 포함한 개선된 표 처리 능력.
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기