중국이 100페이지 분량의 PDF를 한 번에 읽는 3B AI 모델을 오픈 소스로 공개했습니다.
요약
중국에서 100페이지 분량의 PDF를 한 번에 처리할 수 있는 3B 규모의 오픈 소스 모델 'Unlimited-OCR'을 공개했습니다. 페이지별 파싱 없이 전체 문맥을 보존하며 로컬 환경에서 비용 없이 실행 가능한 것이 특징입니다.
핵심 포인트
- 32K 컨텍스트 윈도우로 페이지 간 문맥 보존
- 표준 OCR 벤치마크에서 93%의 높은 성능 달성
- 클라우드 API 없이 100% 로컬 실행 가능
- Transformers, vLLM, Ollama 등 다양한 프레임워크 지원
중국이 100페이지 분량의 PDF 전체를 한 번에 읽을 수 있는 3B AI 모델을 오픈 소스로 공개했습니다.
페이지별 파싱(parsing) 없음.
클라우드 API(Cloud APIs) 없음.
월간 비용 없음.
Unlimited-OCR을 소개합니다 👇
• 32K 컨텍스트 윈도우(context window)로 전체 문서 읽기
• 각 페이지를 개별적으로 처리하는 대신 페이지 간 문맥(cross-page context) 보존
• 표준 OCR 벤치마크에서 93% 달성 (베이스라인 대비 +6)
• 40페이지 이후 에러율(error rate) 0.11 미만
• 기본적으로 다국어 지원
• 100% 로컬(locally)에서 실행
• Transformers, vLLM, Ollama, Docker, llama.cpp 등을 지원
놀라운 점은 무엇일까요?
대부분의 기업용 OCR 시스템은 여전히 문서를 개별 페이지로 분할합니다.
Unlimited-OCR은 전체 문서를 하나의 시퀀스(sequence)로 처리하여, 표(tables), 참조(references), 그리고 긴 문서들을 훨씬 더 신뢰성 있게 처리합니다.
그동안 기업들은 스캔하는 페이지마다 클라우드 OCR 제공업체에 비용을 지불해 왔습니다.
이 모델은 다운로드 후에는 비용이 0달러입니다.
오픈 소스(Open source)는 이제 단순히 따라잡는 수준에 머물지 않습니다.
오픈 소스는 소프트웨어 카테고리 전체를 대체하고 있습니다.
100% 오픈 소스입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @shruti_0810 (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기