
클라우드 OCR의 시대는 끝났습니다
요약
중국에서 3B 파라미터 규모의 오픈 소스 AI 모델인 'Unlimited-OCR'을 공개했습니다. 이 모델은 페이지 분할 없이 32K 컨텍스트 윈도우를 통해 PDF 전체를 한 번에 읽어 문서 구조를 완벽히 보존합니다.
핵심 포인트
- 32K 컨텍스트 윈도우로 문서 전체를 단일 컨텍스트로 처리
- 표, 참조 및 문서의 장기적 구조 보존 가능
- 표준 OCR 벤치마크에서 93%의 높은 성능 달성
- 로컬 실행이 가능한 오픈 소스 모델로 API 비용 절감
- Transformers, Ollama, vLLM 등 다양한 프레임워크 지원
클라우드 OCR (Cloud OCR)의 시대는 끝났습니다.
중국이 단 한 번에 100페이지 분량의 PDF 전체를 읽을 수 있는 3B-parameter (30억 파라미터) 규모의 AI를 오픈 소스로 공개했습니다.
페이지 분할 없음.
컨텍스트 손실 없음.
API 비용 없음.
Unlimited-OCR을 소개합니다 👇
• 32K 컨텍스트 윈도우 (context window)로 문서 전체를 읽음
• 표준 OCR 벤치마크에서 93% 달성 (이전 베이스라인 대비 +6)
• 40페이지 이상에서도 0.11 미만의 에러율 유지
• 별도 설정 없이 다국어 지원
• 사용자의 하드웨어에서 100% 로컬로 실행
• Transformers, Ollama, vLLM, Docker, SGLang 및 llama.cpp 지원
대부분의 OCR 도구들은 여전히 문서를 한 페이지씩 처리합니다.
Unlimited-OCR은 전체 PDF를 단일 컨텍스트 (single context)로 읽어 표, 참조, 그리고 문서의 장기적 구조 (long-range document structure)를 보존합니다.
기업들은 여전히 페이지마다 클라우드 OCR 제공업체에 비용을 지불하고 있습니다.
이것은 무료입니다.
오픈 소스입니다.
그리고 올해 가장 큰 OCR 출시가 될지도 모릅니다.
[IMG:1]
AI 자동 생성 콘텐츠
본 콘텐츠는 X @sulekhat95 (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기