LightOnOCR 3: OCR 출력을 페이지의 특정 위치에 연결하는 기능
요약
LightOnOCR 3은 단순 OCR 출력을 넘어, 추출된 모든 블록을 바운딩 박스와 함께 반환하는 '접지(grounding)' 기능을 제공합니다. 이 기능 덕분에 PDF 기반 RAG 파이프라인에서 데이터의 정확한 위치를 파악할 수 있게 되어 활용도가 높아졌습니다.
핵심 포인트
- '접지' 기능으로 추출된 블록에 바운딩 박스 연결 가능
- PDF 기반 RAG 파이프라인의 데이터 정확도 향상 기대
- Apache 2.0 라이선스로 0.8B, 1B, 4B 세 가지 크기 제공
LightOnOCR 3이 출시되었는데, 제가 주목하는 부분은 벤치마크 수치가 아닙니다. 바로 '접지(grounding)' 기능입니다. 이 기능을 요청하면 추출된 모든 블록이 바운딩 박스(bounding box)와 함께 반환되므로, 차트 값이나 테이블 셀이 스캔한 페이지의 정확한 지점을 가리킬 수 있습니다. 이는 PDF를 RAG 파이프라인에 넣고 숫자가 맞기를 바라는 모든 사람에게 부족했던 부분입니다.
Apache 2.0 라이선스 하에 세 가지 크기(0.8B, 1B, 4B)가 제공되며, LightOn에서는 4B 모델을 추천합니다. 알아두어야 할 두 가지 사항이 있습니다. '접지' 기능은 일반적인 전사(plain transcription)보다 약 25% 더 많은 토큰을 출력하며, vLLM 설정이 매우 엄격하게 고정되어 있으므로 Transformers 라이브러리를 직접 업그레이드하면 1B 모델이 작동하지 않을 수 있습니다.
또한, 75.1의 ParseBench 점수는 LightOn 자체의 수치이며, 공개 리더보드에서는 KDL Frontier Parser nano가 이보다 약간 높은 점수를 기록하고 있습니다. 신뢰하기 전에 가장 보기 안 좋은 스캔본으로 직접 테스트해 보세요.
저희는 모델 선택, 프롬프트 모드 및 평가 체크리스트와 함께 ByteForward에 이 내용을 정리했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기