Qwen3-VL 8B를 노트북에서 Opus 5.5 / Sonnet 5 / GPT-5.6과 비교한 137개 복잡 문서 처리 결과: 세금 양식은
요약
Qwen3-VL 8B 모델을 Claude Opus 5.5, Sonnet 5, GPT-5.6 Terra 등 최신 LLM과 비교하여 복잡한 문서 처리 능력을 테스트했습니다. 세금 양식, 오래된 인보이스, 실제 IRS 양식 등을 다룬 결과, Opus가 가장 높은 정확도(89%)를 보였으며 Qwen 8B는 상대적으로 낮은 성능을 기록했습니다.
핵심 포인트
- Opus 5.5가 복잡한 문서 처리에서 89%의 최고 정확도를 달성했습니다.
- Qwen3-VL 8B는 W-2 양식 등 특정 영역에서 GPT-5.6 Terra 대비 우수한 성능을 보였습니다.
- LLM 사용 시, Ollama 기본 태그 대신 :8b-instruct를 사용하여 사고(thinking) 과정을 활성화하는 것이 중요합니다.
- GPT-5.6 Terra가 특이한 철자 처리 능력에서 예상치 못한 강점을 보여주었습니다.
저는 Qwen3-VL 8B Instruct (Q4_K_M, Ollama, M5 24GB, ~30초/문서)를 Claude Opus 5.5, Sonnet 5 및 GPT-5.6 Terra와 다음 문서들로 비교했습니다:
- 영수증: CORD(인도네시아) 및 SROIE(말레이시아), 각 30개
- 스캔된 1980년대~90년대 인보이스 20개, 정답지는 사람이 검증함
- 실제 IRS 양식 32개, 손상 정도 4단계 (이번 주에 생성되어 누구의 학습 데이터에도 없음)
- 합성 인도 은행 명세서 10개, CUAD 계약서 15개
결과 (문서가 완벽하게 맞은 비율): - Opus: 89%,
- Sonnet: 85%,
- Qwen 8B: 59%,
- GPT-5.6 Terra: 57%.
Qwen 관련 발견 사항: - W-2 양식: 32개 중 21개가 완벽하게 맞음 vs GPT-5.6 Terra의 32개 중 7개
- 인도 은행 명세서: 10개 중 2개. 모든 금액과 잔액이 정확했으나 dd-mm-yyyy를 mm-dd로 읽음.
- 계약서 (긴 텍스트): 15개 중 2개, 대부분 만료 날짜가 틀림
- Ollama의 기본 qwen3-vl:8b 태그는 사고(thinking) 변형이며 think:false를 무시합니다. 긴 계약서에서는 모든 4,096 토큰을 생각하는 데 사용하고 아무것도 반환하지 않았습니다. 대신 :8b-instruct를 사용하세요.
기대하지 못했던 다른 점들: - GPT-5.6 Terra가 특이한 철자(Rachael -> Rachel, Kelleyland -> Kellyland)를
AI 자동 생성 콘텐츠
본 콘텐츠는 r/MachineLearning (hot)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기