32개의 실제 계량기 및 영수증 사진으로 6개 비전 모델 벤치마크 수행: 가격이 정확도를 거의 예측하지 못함
요약
실제 계량기 및 영수증 사진 32장을 활용하여 6개 비전 모델의 필드 수준 정확도를 벤치마크한 결과입니다. 실험 결과, 비용이 높은 모델이 반드시 더 높은 정확도를 보장하지는 않으며, 특정 모델들은 어려운 환경에서 높은 성능을 유지했습니다.
핵심 포인트
- 비용과 정확도가 반드시 비례하지 않음 (Gemini 모델군 성능 유사)
- 어려운 사례(각도, 노이즈 등)에 대한 별도 성능 측정의 중요성
- 정확도 우선 순위 선정 시 가격보다 필드 정확도가 핵심
- 무료 모델(gemma-4-26b)은 폴백 용도로 활용 가능
공개 사항: 이 데이터는 제 개인 앱(휴대폰 사진에서 유틸리티 계량기, 연료 펌프, 연료 영수증 및 주행 거리계를 읽는 앱)에서 가져온 것이므로, 저는 중립적이지 않습니다. 링크는 제공하지 않으며, 수치와 하네스(harness)만 공유합니다. 설정: 계량기, 펌프, 영수증, 주행 거리계 각각 8장씩 총 32장의 사진을 사용했으며, 모두 정확한 값을 알고 있는 상태입니다. 점수 산정은 "파싱 가능한 JSON을 반환했는가"가 아니라 필드 수준(field-level)으로 이루어집니다. 테스트용 복사본이 아닌 실제 프로덕션 프롬프트(prompt)와 파서(parser)를 통해 실행되었습니다. 평균값은 정작 문제를 일으키는 사례들을 가려버리기 때문에, 어려운 하위 집합(긁힌 유리, 바랜 감열지, 각도가 틀어진 사진)은 별도로 점수를 매겼습니다. 동일한 32장의 사진에 대한 필드 정확도: gemini-2.5-flash-lite, $0.10/Mtok, 88.6% (어려운 사례 90%), gemini-3.1-flash-lite, $0.25/Mtok, 93.2% (어려운 사례 80%), gemini-3-flash-preview, $0.50/Mtok, 93.2% (어려운 사례 80%), gemini-flash-latest, $1.50/Mtok, 93.2% (어려운 사례 90%), gemma-4-26b:free, $0, 78.4% (어려운 사례 90%), nemotron-nano-12b-v2-vl:free, $0, 52.3%, 게이트(gate) 통과 실패. $0.25와 $1.50에서 동일하게 93.2%를 기록했습니다. 6배를 더 지불해도 얻은 것이 없었습니다. 각각 재작성이 필요했던 네 가지 사항: 속도 제한(Rate-limited)이 걸린 샘플이 오답으로 처리되면 좋은 모델이 형편없어 보입니다. 이를 재시도한 후 건너뛴 것으로 보고하고, 결론을 내릴 수 없는 실행은 모델의 등급을 올리거나 내리게 두는 대신 폐기하십시오. 각 점수는 측정에 사용된 프롬프트의 해시(hash)와 함께 저장됩니다. 프롬프트를 변경하면 이전 점수는 정의상 오래된 것이 되므로, 게이트는 이전 점수를 신뢰하기보다 다시 측정합니다. 순위는 정확도를 우선하고, 가격을 그다음으로 합니다 (정확도가 동일할 경우 가장 저렴한 것). 저렴한 것을 우선시하면 잘못된 숫자를 포함한 유효한 JSON을 반환하는 모델을 선택하게 됩니다. 승급 게이트(Promotion gate)는 측정된 필드의 70%입니다. 이 수치 미만일 경우, 모델은 사용자의 사진을 절대 처리하지 않습니다. 무료 티어(Free tier)는 오직 폴백(fallback) 용도로만 가치가 있습니다. 사용자에게 확인을 요청할 수 있는 상황이라면 78%의 gemma-4-26b는 사용 가능하지만, 52%의 nemotron은 노이즈에 불과합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기