tencent/Youtu-Parsing-Omni · Hugging Face
요약
Youtu-Parsing-Omni는 5B 크기의 다중 모드(omni-modal) 파싱 모델입니다. 문서, 자연 이미지, 차트, 순서도, 기하학적 도형, 오디오, 비디오 등 다양한 단일 입력을 받아 구조화된 JSON 엔벨로페를 생성합니다. 이 모델은 통합 스키마와 Omni 인코더를 통해 강력한 성능을 보여줍니다.
핵심 포인트
- 다양한 모달리티(문서, 이미지, 오디오, 비디오)를 처리하는 옴니-모달 파싱 모델입니다.
- 단일 입력에서 레이아웃, 텍스트, 테이블, 수식 등 모든 요소를 구조화된 JSON으로 추출합니다.
- OmniDocBench 및 OmniParsingBench 등 여러 벤치마크에서 최고 수준의 성능을 달성했습니다.
Youtu-Parsing-Omni은 작고(5B) 모든 모드(omni-modal)를 처리하는 파싱 모델입니다. 문서 페이지, 자연 이미지, 차트/순서도, 기하학적 도형, 오디오 클립 또는 오디오-비주얼 비디오와 같은 단일 입력을 받으면, 인식(레이아웃 요소, 텍스트, 테이블, 수식, 경계 상자, 타임스탬프, ASR, OCR, 음향 이벤트, 카메라 움직임)과 인지(캡션, 내러티브, 보고서)를 모두 포함하는 하나의 구조화된 JSON 엔벨로페를 생성합니다. 출력 패밀리는 작업 프롬프트에 의해 선택됩니다 (예시의 --task 또는 prompts/youtu_parsing_omni.json의 키 참조).
입력 --task 모달리티 / 서브타입 | 주요 내용
:---|
- Document page: 문서 이미지 / 경계 상자(bbox)가 있는 문서 레이아웃 요소, 텍스트 / LaTeX / OTSL 테이블 / Markdown 차트 / Mermaid 순서도, 읽기 순서
- Natural image: 자연 이미지 / 경계 상자(bbox), 태그, 캡션, 전역 설명이 포함된 이미지 및 텍스트
- Chart: 그래픽_차트 이미지 / 문서를 위한 하나의 차트 요소: Markdown 테이블, 노트, 캡션
- Flowchart: 그래픽_순서도 이미지 / 문서를 위한 하나의 순서도 요소: Mermaid, 캡션
- Geometry figure: 그래픽_기하학 이미지 / 문서를 위한 하나의 기하학적 요소: 점, 선, 호, 도형, 기하학적 관계 및 측정값
- Audio: 오디오 오디오 / 타임스탬프, 화자, ASR, 음색/장면 캡션, 음향 이벤트가 있는 음성/비음성 세그먼트
- Natural video: 자연_비디오 비디오 / 비주얼 요소, 동작, 상호 작용, 카메라 움직임, 오디오 트랙이 포함된 자연_비디오 시간적 세그먼트
- Text-rich video: 텍스트 풍부 비디오 텍스트풍부_비디오 비디오 / OCR + ASR 및 전체 비디오에 대한 Markdown 구조화 보고서가 있는 텍스트_비디오 세그먼트
주요 특징 (기술 보고서 참조):
- 통합 스키마: 작업 프롬프트에 의해 구동되는, 일곱 가지 파싱 패밀리를 위한 하나의 JSON 엔벨로페.
- Omni 인코더: 이미지, 오디오 및 인터리브된 오디오-비주얼 비디오 입력(프레임 + 오디오 트랙)을 단일 모델에서 처리합니다.
작은 크기에도 강력한 성능을 보여줍니다. OmniDocBench v1.6에서 최고 수준의 성능(Overall 96.96)을 달성했으며, OmniParsingBench에서는 최고의 오픈 웨이트 모델입니다(평균 75.08점, Gemini-3-Pro 다음). 또한 화학 구조(ChemOCR) 및 악보(PDMX-Synth) 인식 분야에서도 전문화된 모델들과 경쟁할 만한 성능을 보였습니다 (결과). 사용하기 쉽습니다. vLLM 플러그인, 고정된 서빙 설정, 태스크 프롬프트 및 추론 예시가 포함되어 있습니다. /u/jacek2023 제출 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기