
『가장 똑똑한 모델』이 반드시 가장 이득인 것은 아니다 ― OCR에서 LLM의 가성비를 실측하다
요약
OCR 작업 시 무조건 고성능 모델을 사용하는 것보다, 경량 모델의 사고량(thinking level)을 조절하는 것이 비용 대비 정확도 측면에서 더 효율적일 수 있음을 실측을 통해 증명합니다.
핵심 포인트
- Gemini Flash-Lite 모델에 중간 정도의 사고량을 적용할 때 가성비가 가장 높음
- 경량 모델과 적절한 사고량의 조합이 중량 모델의 낮은 설정보다 우수한 성능을 보임
- OCR 성능 측정 시 그림/주석을 제외한 nofig CER과 전체 raw CER을 모두 고려해야 함
- 데이터 특성에 따라 최적의 모델과 사고량 설정이 달라지므로 직접 측정이 필요함

서론
OCR(이미지나 PDF를 문자 데이터로 변환하는 처리)에 지금은 LLM(대규모 언어 모델)을 사용할 수 있습니다. 하지만 "어떤 모델을 어떤 설정으로 사용하는 것이 가장 이득인가"는 공표된 스펙이나 벤치마크의 평판만으로는 결정되지 않습니다. 대상 데이터가 바뀌면 최적해(Optimal solution)도 바뀌기 때문입니다.
이에 서적 1권의 OCR을 주제로, 여러 Gemini 모델과 그 "사고량(thinking level)"을 변화시키며 정확도와 비용을 측정했습니다. 결론부터 말씀드리면, 비용과 본문 판독 정확도의 균형 측면에서 유력한 후보가 된 것은 최고 정확도 모델이 아니라, 경량 모델인 Flash-Lite를 중간 정도의 사고량으로 사용하는 설정이었습니다. 이하에서는 측정 방법, 결과, 그리고 "자신의 데이터로 측정하기" 워크플로우로서의 적용 방법을 정리합니다.
본 기사는 특정 조건(서적 1권)에서의 검증입니다. 수치는 이 조건에서의 상대적 비교로 읽어 주시기 바랍니다.
검증 셋업
대상: 비즈니스 서적 1권의 PDF(펼침면 202면). 중복되지 않도록 계통 추출한 60면(30면 × 2세트).
정확도 지표: CER(문자 오차율, character error rate). NFKC로 표기 불일치를 정규화하고, 공백을 제외한 문자열 간의 Levenshtein 거리 ÷ 참조 문자 수. 페이지를 문자 수로 가중한 micro 평균. 낮을수록 좋습니다.
정답 데이터(GT): 수작업을 통한 완전한 정답은 만들지 않고, 두 개의 서로 다른 vision 모델에 각각 전문을 필기하게 하여, 그 두 개를 각각 별도의 참조로 삼아 각자의 CER을 산출했습니다(일치하는 부분을 정답으로 삼은 것이 아닙니다). 표의 CER은 GT별로 micro CER을 산출한 후, 그 두 값을 단순 평균한 값입니다. 두 참조의 일치도는 평균 0.94~0.95이며, 인적 판정은 없었습니다.
- 비교 모델 및 단계: Gemini 3.5 Flash(low) / 3.5 Flash-Lite(minimal·low·medium·high) / 3.6 Flash(low·medium). 모든 모델에서 모든 단계를 적용한 것은 아닙니다.
CER은 두 가지 방식으로 병기합니다. raw는 OCR 출력 전문의 CER이며, nofig는 OCR 출력 중 Markdown 인용 행(>로 시작하는 행. 그림의 표현이나 "확인 필요" 주석 포함)을 제외한 CER입니다. 그림 주변은 읽기 순서나 레이아웃의 영향을 받기 쉬워 본문 판독 정확도가 묻히기 쉬우므로, 양쪽을 모두 확인해야 판단이 달라집니다.
결과 1: 경량 모델 + 사고량 조절이 중량 모델의 저설정을 상회함
단순한 비교로서, 중량 모델인 Gemini 3.5 Flash(낮은 사고량)와 경량 모델인 Gemini 3.5 Flash-Lite(중간 사고량)를 나란히 비교하면:
- CER은 두 세트 모두 개선(약 2할~3할 미만, raw)
- 처리 비용은 두 세트 모두 7할 이상(약 72~74%) 감소
경량 모델로 바꾸면서 정확도와 비용 모두 좋아졌습니다. 다만 주의할 점은, 이 비교는 모델과 사고량을 동시에 변경했다는 것입니다. 실제로 동일한 "낮은" 사고량끼리 비교하면 중량 모델인 Flash의 CER이 더 낮으며(후술할 표 참조), 경량화 자체가 정확도를 높이는 것은 아닙니다. 효과를 본 것은 "경량 모델 + 적절한 사고량"이라는 조합입니다.
결과 2: 모델 × 사고량의 전체상
제1세트 30면에 대한 raw / nofig CER 및 상대 비용(Flash-Lite 중간 = 1.0)입니다.
| 모델·설정 | raw CER | nofig CER | 상대 비용 |
|---|---|---|---|
| Flash-Lite (minimal) | 0.200 | 0.191 | ×0.73 |
| ... | |||
| 읽을거리: |
- 일률적인 "낮음"이 최선은 아니다. Flash-Lite는 low 설정이 최악(raw 0.279)이었으며, minimal, medium, high 설정 모두에서 성능이 개선되었습니다. 당초 모든 모델에 일률적으로 low를 적용했으나, 각 모델의 실력을 제대로 끌어내지 못하고 있었습니다. -
"사고량(reasoning effort)은 높을수록 좋다"도 아니다. raw 데이터에서는 Flash-Lite의 minimal / medium / high가 거의 비슷한 수준(0.20 전후)이었으나, nofig(도표 제외)에서는 medium(0.179)이 최상이었고 high(0.222)는 오히려 악화되었습니다. 즉, 너무 많이 생각하는 것이 문제입니다. 어떤 지표로 보느냐에 따라 결론이 달라집니다. -
왜 medium을 유력한 후보로 꼽는가. raw 데이터만 보면 minimal(0.200)은 medium(0.201)과 대등하며 비용도 더 저렴합니다(×0.73). 하지만 도표 주변의 노이즈를 제외한 nofig에서는 medium(0.179)이 minimal(0.191)보다 명확하게 우수합니다. 본문 판독 정밀도를 중시한다면 medium이라는 것이 이번 분석의 판단입니다(평가 축을 어떻게 설정하느냐에 따라 결론은 달라질 수 있습니다). -
같은 "낮음" 설정이라면 무거운 모델이 유리하다. Flash low(0.250)는 Flash-Lite low(0.279)보다 CER이 낮습니다. 가벼움이 항상 만능은 아닙니다.
결과 3: 최고 정밀도는 약 7배의 비용
이번에 테스트한 설정 중 CER이 가장 낮았던 것은 3.6 Flash(중간 단계, raw 0.188 / nofig 0.169)였습니다. 다만 비용은 Flash-Lite(중간 단계)의 약 7.2배입니다. 정밀도는 한 단계 높지만, 비용 차이가 매우 큽니다.
용도에 따른 구분은 간단합니다. **밸런스를 중시한다면 Flash-Lite(중간 단계), 정밀도를 최우선한다면 3.6 Flash(중간 단계)**를 선택하십시오.
실무 적용 방법
이 검증을 통해 도출할 수 있는, 재현 가능한 워크플로우입니다.
- 후보 모델을 자신의 대상 데이터로 측정하라. 공칭 스펙이나 범용 벤치마크 순위가 아니라, 실제로 처리할 문서로 CER(또는 적절한 지표)을 산출해야 합니다. -
사고량 (reasoning effort)은 모델마다 튜닝하라. 일률적인 설정은 손해입니다. 높인다고 무조건 좋은 것도 아닙니다. 이번에 4단계 설정을 테스트할 수 있었던 것은 Flash-Lite뿐이었으며, 모델마다 탐색할 가치가 있습니다. -
평가 지표를 하나로 고정하여 비교하라. raw냐 nofig(도표 표현 행을 제외한 것)냐에 따라 최적 설정이 달라질 수 있습니다. 지표를 섞지 마십시오. -
비용은 상대적으로 보고, 용도에 따라 티어(Tier)를 나누라. "모두를 최고 정밀도로"가 아니라 "필요한 정밀도를, 필요한 비용으로" 구현해야 합니다.
요약
- OCR을 위한 LLM 선택은 공칭 스펙이 아니라 자신의 데이터로 측정할 때 최적해(Optimal solution)가 달라집니다.
- 이번 테스트에서 비용과 본문 정밀도의 밸런스를 고려한 유력한 후보는 경량 모델(Flash-Lite·중간 단계)입니다. 최고 정밀도 모델은 비용이 약 7배 더 듭니다.
- 사고량은 "높을수록 좋다"가 아니라, 모델마다 측정하여 선택해야 합니다. 평가 지표를 어떻게 설정하느냐에 따라 결론도 달라집니다.
본 검증을 "업무에 어떻게 도입할 것인가" (무엇을 AI에 맡기고, 어떤 정밀도를 어떤 비용으로 보장할 것인가)라는 운영 관점에서 정리한 내용은 운영사의 lab note에 있습니다.
→ https://nihonbashi.ai/blog/ocr-model-cost-and-accuracy
Discussion

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기