Baidu, 40페이지 분량의 문서를 한 번에 읽는 OCR 모델 오픈소스 공개
요약
Baidu가 40페이지 분량의 문서를 한 번에 처리할 수 있는 오픈소스 OCR 모델 'Unlimited-OCR'을 공개했습니다. 32K 컨텍스트 윈도우를 통해 페이지 간 문맥과 표, 수식 등을 구조화된 마크다운 형식으로 정확하게 보존합니다.
핵심 포인트
- 32K 컨텍스트 윈도우로 페이지 간 문맥 및 표 구조 보존
- 30억 파라미터 모델이나 추론 시 5억 개만 활성화하여 효율적
- 표준 벤치마크에서 93%의 높은 정확도 기록
- 로컬 환경에서 무료로 실행 가능한 오픈소스 모델
Baidu가 40페이지 분량의 문서 전체를 한 번에 읽을 수 있는 OCR 모델을 방금 오픈소스(open-source)로 공개했습니다.
이 모델의 이름은 Unlimited-OCR입니다. 30억 개의 파라미터(parameters)를 가지고 있지만, 추론(inference) 중에는 5억 개만 활성화됩니다. 사용자의 기기에서 100% 로컬(locally)로 실행됩니다.
이것이 중요한 이유: 기존의 OCR 도구들은 문서를 페이지 단위로 잘라서 처리합니다. 두 페이지에 걸쳐 있는 표(tables)는 깨지게 됩니다. 읽기 순서(reading order)가 유실됩니다. 페이지 간의 문맥(cross-page context)이 사라집니다.
Unlimited-OCR은 문서 전체를 한 번에 처리합니다. 32K 컨텍스트 윈도우(context window)를 지원합니다. 텍스트, 공식(formulas), 표, 읽기 순서가 페이지 전반에 걸쳐 모두 보존됩니다.
출력은 깔끔한 구조화된 마크다운(Markdown) 형식으로 제공됩니다.
→ 표준 벤치마크(benchmark)에서 93%의 정확도를 기록했습니다. 베이스라인(baseline) 대비 6포인트 상승했습니다.
→ 40페이지가 넘어가도 오류율(error rate)이 0.11 미만으로 유지됩니다.
→ 별도의 설정 없이 다국어(multilingual)를 지원합니다.
→ 지난달 Hugging Face에서 212만 회 다운로드되었습니다. GitHub 스타(stars)는 14,600개를 기록했습니다.
참고로: Amazon Textract, Google Cloud Vision, Azure Document Intelligence는 모두 페이지당 비용을 부과합니다. 이 모델은 로컬에서 무료로 실행됩니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @nainsidwiv50980 (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기