곡면 타이어 측벽 OCR에 대한 최첨단 AI 성능 측정
요약
본 글은 곡면 타이어 측벽에 새겨진 복잡한 텍스트를 읽는 최첨단 OCR 성능을 측정하는 연구 보고서입니다. 기존의 좌표 기반 객체 탐지 방식으로는 휘거나 저대비인 실제 타이어 코드를 재구성하기 어렵다는 한계를 지적합니다. 이에 따라, 다양한 LLM(Gemini, Claude, GPT 등)을 활용하여 제로샷으로 구조화된 타이어 사양 추출 능력을 평가했습니다.
핵심 포인트
- 곡면/저대비 텍스트 인식은 기존 OCR의 난제입니다.
- LLM 기반 VLM이 YOLO 데이터셋 감사자 역할을 할 수 있는지 검증합니다.
- Gemini, Claude, GPT 등 최신 모델들이 경쟁적으로 테스트되었습니다.
- 정확한 구조화된 사양 추출 능력이 핵심 평가 지표입니다.
_이 글은 Kaggle Benchmarking Challenge 제출물입니다.
무엇을 테스트했는가
자동차 제조, 차량 유지보수, 타이어 재활용 분야의 컴퓨터 비전 파이프라인에서 타이어 사양을 읽는 것은 악명 높은 난제입니다.
타이어 측벽에는 휠의 원형 아크를 따라 양각된 검은색-검은색 고무 텍스트가 있습니다. YOLO와 같은 사용자 지정 객체 탐지 모델을 훈련하여 개별 문자 상자(/, 0-9, R)를 감지할 때, 전통적인 후처리 과정은 수평 X 좌표로 바운딩 박스를 정렬하여 타이어 코드(예: 205/55R16)를 재구성하는 데 의존합니다.
하지만 이러한 단순한 접근 방식은 실제 타이어에서는 실패합니다:
- 곡률 및 회전: 텍스트가 휠 아크 측면을 따라 휘거나 수직/거꾸로 방향이 되어 있을 때, 좌표 기반 정렬은 순서를 역전시키거나 뒤섞습니다(예:
225/60R18이81R06/522로 읽힘). - 저대비 검은색-검은색 고무: 먼지, 그림자, 타이어 마모는 표준 OCR 도구가 작동하지 못하게 만듭니다.
질문:
최첨단 범용 Vision-Language Models (VLMs)가 미세 조정(fine-tuning) 없이 원본 타이어 측벽 사진에서 ISO 규격의 타이어 크기 사양([폭]/[비율]R[림])을 제로샷 OCR 및 구조화된 추출할 수 있으며, 사람이 주석을 단 YOLO 데이터셋에 대한 자동 감사자 역할을 할 수 있을까요?
이를 측정하기 위해, 저는 검증된 정답 레이블이 있는 22가지의 서로 다른 타이어 치수를 아우르는 51장의 타이어 측벽 이미지로 구성된 큐레이션 테스트 스위트를 만들었습니다.
테스트한 모델들
실시간 Kaggle Benchmark는 5개의 AI 제공업체와 오픈 웨이트 아키텍처에 걸쳐 11가지 최첨단 모델을 평가합니다:
- Google: Gemini 3.8 Flash, Gemini 3.5 Flash-Lite, Gemini 2.5 Pro, and Gemma 4 31B (Open Weights).
- Anthropic: Claude Opus 5.5, Claude Sonnet 5.5, and Claude Haiku 5.5.
- OpenAI: GPT-6.1 Sol and gpt-oss-20b (open-weights).
- Alibaba: Qwen 3 Next 80B Thinking.
- Zhipu AI: GLM-5.
(참고: 작업 탐색 과정에서 Gemini 3.7 Flash [46/51], Gemini 3 Flash Preview [45/51], 그리고 Claude Sonnet 5 [44/51]도 기본 과제에 대해 평가되었습니다. DeepSeek-R1은 시각 인코더가 부족한 텍스트 전용 추론 모델로 기준점(benchmark) 실행기에서 올바르게 거부되었으며, Grok 4.6은 상위 프록시 연결 시간 초과를 경험했습니다).
평가 설정 및 과제 논리 (Evaluation Setup & Task Logic)
각 모델에는 이미지당 고립된 컨텍스트가 제공되었습니다:
"이 이미지의 타이어 측벽을 주의 깊게 검사하십시오. 표준 ISO 미터법 타이어 크기 사양(형식: WWW/AARDI, 예: 205/55R16, 225/60R18, 235/65R17)을 찾으십시오. 정확한 9자리 타이어 크기 코드만 반환하십시오."
기준점은 다음 내용을 기록했습니다:
- 정확 문자열 일치 (Exact String Match): 전체 9자리 코드가 정답(ground truth)과 일치했는가?
- 구성 요소 정확도 (Component Accuracy): 섹션 폭(Section Width, mm), 종횡비(Aspect Ratio, %), 그리고 림 직경(Rim Diameter, inches)의 개별적인 정확성.
- 방향 적합성 (Orientation Robustness): 수평 대 곡선/수직 아크에서의 성능.
결과 (Findings)
리더보드 결과 (Leaderboard Results)
아래 표는 라이브 Kaggle Benchmark의 공식 리더보드를 반영합니다:
⚠️ [IMG:N] 형식 토큰은 이미지 placeholder 입니다. 번역하지 말고 원래 위치에 그대로 유지하세요.
| Rank | Model | Provider | Exact Matches | Exact Accuracy | Key Behavior |
|---|---|---|---|---|---|
| #1 | Google Gemini 3.8 Flash | 46 / 51 | 90.20% | Tied #1; top multimodal speed & curved text accuracy | |
| ... |
Kaggle UI 점수 표시 참고: Kaggle Benchmarks 리더보드 UI에서는 원시 숫자 점수가 자동 × 100% 표시 배지(예:
46.00은4600.0%로,41.00은4100.0%로 표시되며, 이는 총 51개 샘플 중 각각 46개와 41개의 정답 항목을 나타내어 90.20% 및 80.39%를 의미합니다.)로 표시됩니다. 위의 표는 정규화된 정확한 백분율 비율을 제공합니다.
비용 대 정확도: 파레토 프론티어 (Pareto Frontier)

비전 모델을 프로덕션 환경에 배포할 때—예를 들어, 자동차 차량군이나 재활용 시설에서 매일 수천 개의 타이어 측벽을 스캔하는 경우—원시 정확도는 추론 비용(inference cost)과 균형을 이루어야 합니다. Kaggle Benchmarks는 평가된 모든 모델에 걸쳐 **점수 대 총 비용 파레토 프론티어 (Score vs. Total Cost Pareto Frontier)**를 도표로 나타냈습니다:
효율성 프론티어 하이라이트 (Highlights from the Efficiency Frontier):
- 최대 ROI 우승자 — Claude Haiku 5.5: 총 평가 비용이 ~$0.005로 매우 낮으면서도 **41 / 51 (80.39%)**의 점수를 기록한 Claude Haiku 5.5는 파레토 프론티어(Pareto frontier)의 가파른 상승세를 이끌었습니다. 높은 볼륨의 자동 분류 작업에서 비용 대비 정확도가 타의 추종을 불허합니다.
- 실용적인 스위트 스팟 — Gemini 3.5 Flash-Lite: 전체 51개 이미지 세트에 단지 ~$0.02만 사용한 Gemini 3.5 Flash-Lite는 **45 / 51 (88.24%)**를 달성하며, 5배에서 15배 더 비싼 모델들보다 뛰어난 성능을 보였습니다. 이 모델은 효율적(Efficient) 사분면에 정확히 위치합니다.
- 최고 성능의 프론티어 — Claude Opus 5.5: Claude Opus 5.5는 파레토 프론티어의 오른쪽 끝점을 형성하며, Gemini 3.8 Flash와 함께 최고 수준의 정확도인 **46 / 51 (90.20%)**를 제공했으며, 총 비용 ~$0.15로 완벽한 포맷팅 정밀도를 보여주었습니다.
- 비효율적 사분면: Qwen 3 Next 80B Thinking (
$0.14) 및 GLM-5 ($0.30)와 같은 모델들은 내부 추론 과정(internal reasoning traces)에서 과도한 출력 토큰을 생성하여 API 비용이 증가하고, 엄격한 9자리 추출 제약 조건을 충족하지 못했기 때문에 하단 오른쪽의 비효율적(Inefficient) 사분면에 속했습니다.
주요 통찰 및 놀라운 점 (Key Insights & Surprises)
1. Zero-Shot VLM이 '회전 트랩(Rotation Trap)'을 완전히 해결하다
YOLO 데이터셋에서, 회전하거나 곡선인 타이어 아크에 대한 인간의 주석은 종종 바운딩 박스 정렬 알고리즘(예: 81R06/522 또는 71R05/522 생성)에 의해 뒤섞였습니다.
모든 최고 수준의 프론티어 VLM은 이러한 회전되고 곡선인 타이어를 올바른 의미적 인간 읽기 순서로 아무런 어려움 없이 읽어내어, 225/60R18 및 225/50R17을 완벽하게 출력했습니다. 이는 멀티모달 LLM이 취약한 기하학적 축 투영(geometric axis projections) 방식이 아니라, 게슈탈트 스타일(gestalt-style)로 연속적인 텍스트 스트림을 인식한다는 것을 입증합니다.
2. 최고 기록: Gemini 3.8 Flash와 Claude Opus 5.5가 공동 1위 (90.20%)
Google의 Gemini 3.8 Flash와 Anthropic의 플래그십 모델인 Claude Opus 5.5가 각각 **46 / 51 (90.20%)**의 동일한 점수로 최고 기록을 차지했습니다. Claude Opus 5.5는 희미하게 양각된 문자 구별에서 엄청난 정밀도를 보여준 반면, Gemini 3.8 Flash는 이와 같은 정확도를 번개처럼 빠른 추론 시간으로 제공했습니다.
그 바로 뒤를 이어 Google의 경량 모델인 Gemini 3.5 Flash-Lite가 **45 / 51 (88.24%)**를 기록하며, Gemini 2.5 Pro(44 / 51)나 GPT-6.1 Sol(39 / 51) 같은 강력한 모델들을 능가했습니다. 이는 전문화된 비전 증류(vision distillation)가 순수한 모델 매개변수 규모보다 더 나은 성능을 보일 수 있음을 입증합니다.
3. Gemma 4 31B: 오픈 가중치 산업용 비전의 승리
가장 흥미로운 결과 중 하나는 Gemma 4 31B가 **80.39% (41 / 51)**를 기록했다는 점입니다. 이 모델은 독점적인 최첨단 플래그십 모델인 Claude Sonnet 5.5와 Claude Haiku 5.5에 필적했으며, OpenAI GPT-6.1 Sol(76.47%)을 능가했습니다. 클라우드 API 의존성 없이 현지(on-premise)에서 실행해야 하는 제조 공장 및 타이어 야적장을 위해 Gemma 4 31B는 생산 등급의 제로샷 OCR 기능을 제공합니다.
4. Claude Haiku 5.5, 자체 무게를 훨씬 뛰어넘다
Anthropic의 Claude Haiku 5.5는 Claude Sonnet 5.5와 정확히 같은 점수인 **41 / 51 (80.39%)**를 기록했습니다. Haiku의 속도 및 비용 프로파일에서 플래그십급 멀티모달 OCR 정확도를 얻을 수 있다는 점은 이 모델을 높은 처리량 배치 감사(high-throughput batch auditing)에 탁월한 후보로 만듭니다.
5. 순수 추출 작업에서의
최상위 모델이 실패한 약 10%의 사례에서 발생한 오류는 무작위적인 환각(hallucination)이 아니었습니다:
- Sample 39 (
235/45R18)에서는 모델이225/45R18로 예측했습니다 (마모된 양각의3을2로 오인). - Sample 34 (
245/50R20)에서는 모델이265/50R20으로 예측했습니다 (4를6으로 오인). - Sample 29 (
255/60R18)에서는 심하게 마모된 측벽에서 폭(width)과 리드(rim) 정보를 잘못 읽었습니다.
거의 모든 실패 사례에서 **종횡비(Aspect Ratio)**와 **구조('R')**는 100% 정확하게 유지되었다는 점에 주목하십시오. 오류는 거의 전적으로 낮은 대비도의 검은색 고무 양각으로 인해 발생한 십 미터(ten millimeter) 단위의 폭 혼동이었습니다.
7. 자동화된 데이터셋 감사 잠재력 (Automated Dataset Auditing Potential)
벤치마크 준비 과정에서, 우리는 원래 데이터셋에 주석을 단 사람이 R 대신 3을 입력한 타이포(typo)를 발견했습니다 (255/60318). 추론(inference) 과정에서 모델들은 타이어 코드의 의미적 도메인 인식(semantic domain awareness)을 바탕으로 자연스럽게 255/60R18을 출력했으며, 이는 VLM(Vision-Language Models)이 산업용 라벨링 파이프라인에 효과적인 자동 검증 감사자(automated validation auditors) 역할을 할 수 있음을 입증합니다.
나의 벤치마크 (My Benchmark)
전체 벤치마크, 코드, 실시간 평가 실행은 Kaggle에서 직접 확인할 수 있습니다:
- 벤치마크 페이지: TireSidewall-Bench on Kaggle
- 과제 및 모델 리더보드: tire-sidewall-ocr 과제 상세 정보
- 모델 비교 보기: Interactive Model Compare
- 벤치마크 데이터셋: Tire Sidewall Benchmark Dataset on Kaggle
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기