중국에서 모든 것을 바꿀 새로운 OCR 모델을 출시했습니다
요약
Baidu가 출시한 Unlimited-OCR은 3B 파라미터 규모로 100페이지 분량의 PDF를 단 한 번의 패스로 처리하는 혁신적인 모델입니다. 페이지 분할 없이 전체 문서를 하나의 컨텍스트로 읽어 표와 문서 구조를 완벽하게 보존하며, 로컬 환경에서 100% 실행 가능합니다.
핵심 포인트
- 32K 컨텍스트 윈도우로 문서 전체를 연속적으로 처리
- 페이지 분할 없는 방식으로 표 및 문서 구조 보존
- 클라우드 API 없이 사용자 하드웨어에서 로컬 실행 가능
- Transformers, vLLM, Ollama 등 주요 프레임워크 호환
- OCR 파싱 벤치마크에서 93%의 높은 점수 기록
중국에서 모든 것을 바꿀 새로운 OCR 모델을 출시했습니다.
단 3B-parameter 규모의 작은 모델이 100페이지 분량의 PDF 전체를 단 한 번의 패스(pass)로 읽을 수 있습니다.
페이지 분할 없음.
문맥 손실 없음.
클라우드 API 없음.
Unlimited-OCR을 소개합니다 👇
• 32K 컨텍스트 윈도우(context window)로 전체 문서를 읽음
• OCR 파싱 벤치마크에서 93% 점수 기록 (베이스라인 대비 +6점)
• 40페이지 이상에서도 오류율을 0.11 미만으로 유지
• 즉시 사용 가능한 다국어 지원
• 사용자 하드웨어에서 100% 로컬로 실행
• Transformers, vLLM, SGLang, Docker, Ollama, llama.cpp와 호환
이것이 중요한 이유입니다.
대부분의 OCR 시스템은 여전히 모든 페이지를 별개의 이미지로 취급합니다.
이는 표가 깨지거나, 참조가 유실되고, 페이지 간의 관계가 누락됨을 의미합니다.
Unlimited-OCR은 문서 전체를 하나의 연속적인 컨텍스트(context)로 처리합니다.
따라서 표가 온전하게 유지됩니다.
참조가 연결된 상태로 남습니다.
문서 구조가 처음부터 끝까지 보존됩니다.
반면, 많은 기업들은 여전히 다음과 같은 상황에 처해 있습니다:
• 1,000페이지당 1.50달러에서 15달러를 지불함
• 민감한 PDF를 클라우드 제공업체에 업로드함
• OCR API 응답을 기다림
이 모델은 완전히 오프라인으로 작동합니다.
구독료 없음.
API 비용 없음.
오직 귀하의 하드웨어만 있으면 됩니다.
DeepSeek-OCR을 뛰어넘기 위해 Baidu가 구축했습니다.
이미 Hugging Face에서 190만 회 이상의 다운回수를 기록했습니다.
놀랍게도, 아직 이에 대해 이야기하는 사람이 거의 없습니다.
오픈 소스는 "기업용 소프트웨어"와 "무료" 사이의 격차를 계속해서 줄여나가고 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @DAIEvolutionHub (AI 자동화)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기