중국이 OCR 비즈니스를 끝내버렸습니다
요약
Baidu가 개발한 Unlimited-OCR은 3B 파라미터 규모의 모델로, 페이지 분할 없이 100페이지 분량의 PDF를 단일 컨텍스트로 처리합니다. 높은 벤치마크 성능을 유지하면서도 로컬 환경에서 무료로 실행 가능하여 기존 클라우드 기반 OCR의 비용과 보안 문제를 해결합니다.
핵심 포인트
- 32K 컨텍스트 윈도우로 문서 전체의 레이아웃과 관계 보존
- 표준 OCR 벤치마크에서 93%의 높은 정확도 달성
- 클라우드 비용 없이 사용자 로컬 하드웨어에서 100% 실행 가능
- Transformers, vLLM, Ollama 등 다양한 프레임워크 지원
중국이 OCR 비즈니스를 끝내버렸습니다.
땅콩 크기만한 3B-parameter 모델이 100페이지 분량의 PDF 전체를 한 번에 읽을 수 있습니다.
페이지 분할 없음.
컨텍스트 손실 없음.
클라우드 비용 없음.
Unlimited-OCR를 소개합니다 👇
• 32K 컨텍스트 윈도우 (context window)로 전체 문서 읽기 가능
• 표준 OCR 파싱 벤치마크에서 93% 달성 (베이스라인 대비 +6)
• 40페이지 이상에서도 오류율 0.11 미만 유지
• 별도 설정 없이 다국어 지원
• 사용자의 하드웨어에서 100% 로컬로 실행
• Transformers, vLLM, SGLang, Docker, Ollama 및 llama.cpp 지원
정말 놀라운 점은 이것입니다:
대부분의 OCR 도구들은 여전히 문서를 한 페이지씩 처리합니다.
Unlimited-OCR은 문서 전체를 단일 컨텍스트 (single context)로 읽어 표, 참조, 레이아웃 및 페이지 간의 관계를 보존합니다.
이것은 모든 것을 변화시킵니다.
그동안 기업들은 다음과 같은 비용을 지불해 왔습니다:
• 1,000페이지당 $1.50–$15
• 민감한 PDF를 클라우드 제공업체로 전송
• API 응답 대기
이 모델은 이를 오프라인에서 수행합니다.
무료로.
영원히.
DeepSeek-OCR을 넘어서기 위해 Baidu가 구축했습니다.
이미 Hugging Face에서 190만 회 이상의 다운로드를 기록 중...
...그리고 아직 거의 아무도 이에 대해 이야기하지 않고 있습니다.
오픈 소스 (Open source)는 대부분의 기업용 소프트웨어보다 빠르게 움직이고 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @RodmanAi (AI 생산성)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기