우리의 멀티모달(Multimodal) API 스택: 가격, 테스트 및 트레이드오프(Tradeoffs)
요약
B2B 문서 처리 파이프라인 구축 과정에서 겪은 멀티모달 API 비용 문제와 이를 해결하기 위한 모델별 성능 및 가격 비교 분석을 다룹니다. Qwen, GLM, Hunyuan 등 다양한 모델의 객체 인식 능력과 비용 효율성을 실제 테스트를 통해 검증합니다.
핵심 포인트
- 유명 브랜드 모델은 성능은 뛰어나나 규모 확장 시 비용 부담이 매우 큼
- Qwen3-VL-32B는 복잡한 이미지 내 세부 객체 및 텍스트 인식 성능이 우수함
- GLM-4.5V는 매우 저렴한 비용($0.01/M)으로 적절한 성능을 제공함
- 모델 선택 시 시각적 선명도와 비용, 특정 맥락(아시아 등) 지원 여부를 고려해야 함
솔직히 말씀드리면, 우리의 멀티모달(Multimodal) API 스택: 가격, 테스트 및 트레이드오프(Tradeoffs)에 대한 이야기입니다.
6개월 전, 저희 팀은 한계에 부딪혔습니다. B2B 고객을 위한 문서 처리 파이프라인을 구축하고 있었는데, 비전(Vision) API 비용이 마치 두 번째 급여 명세서처럼 보이기 시작했습니다. 저는 3주 동안 Global API를 통해 손에 넣을 수 있는 모든 멀티모달(Multimodal) 모델을 해체하고, 동일한 테스트 과정을 거치게 하며, 모든 달러를 매핑했습니다. 제가 발견한 것과 그것이 우리가 비전(Vision) 기능을 설계하는 방식을 어떻게 완전히 바꾸었는지 공유하겠습니다.
우리가 유명 브랜드의 기본 설정을 거부한 이유
제가 이 회사에 합류했을 때, 창업자는 이미 모든 것을 유명 멀티모달(Multimodal) 제공업체 중 하나에 연결해 둔 상태였습니다. 어떤 곳인지 아실 겁니다. Twitter에서 보는 모든 데모, 그들이 직접 발표하는 모든 벤치마크 차트의 주인공 말이죠. 성능은 훌륭합니다. 하지만 규모가 커지면 비용이 엄청나게 발생합니다.
저는 우리의 성장 궤적이 어떤 모습일지 계산하기 시작했습니다. 우리는 2분기 내에 한 달에 10,000장의 이미지를 처리할 것으로 예상했습니다. 출력 100만 토큰당 3.00달러인 Doubao-Seed-2.0-Pro 티어를 사용할 경우, 출력 토큰 비용만으로도 월 약 150달러가 발생하게 됩니다. 그리고 이는 입력 비용, 재시도(Retries), 또는 출시 3주 후에 항상 발생하는
| 모델 (Model) | 제공자 (Provider) | 모달리티 (Modalities) | 출력 비용 $/M | 컨텍스트 (Context) |
|---|---|---|---|---|
| Qwen3-VL-32B | Qwen | 이미지 + 텍스트 | $0.52 | 32K |
| ... | ||||
| GLM-4.5V 행을 보세요. 출력 비용이 $0.01/M입니다. 이것이 실제로 사용 가능한지에 대해서는 나중에 다시 다루겠습니다. 저 역시 그 가격대에서는 의구심이 들었기 때문입니다. |
테스트 1: 실제 이미지에서의 객체 인식 (Object Recognition)
저는 스톡 사진 사이트에서 복잡한 도쿄 거리 장면을 가져왔습니다. 수많은 표지판, 혼합된 언어, 보행자, 차량 등 모든 것이 포함되어 있었습니다. 모든 모델에 동일한 이미지를 보내며 "이 이미지에서 보이는 모든 것을 설명하세요"라는 프롬프트를 입력했습니다.
Qwen3-VL-32B는 15개 이상의 뚜렷한 객체, 프레임 안에 있는지조차 잊고 있었던 브랜드 이름들을 답변으로 내놓았으며, 심지어 지나가는 버스에 적힌 텍스트까지 포착했습니다. 이는 고객이 사진을 업로드하고 우리가 실제로 이를 이해하기를 기대할 때 제가 필요로 하는 수준의 디테일입니다.
GLM-4.6V는 그 뒤를 바짝 쫓았으며, 특히 아시아 맥락(Asian-context)의 세부 사항에 있어서 Qwen 모델들보다 눈에 띄게 뛰어났습니다. Zhipu의 학습 데이터 분포를 고려하면 이는 타당한 결과입니다. 만약 해당 시장을 타겟으로 구축하고 있다면, 이것이 여러분의 기본 선택지가 될 것입니다.
Qwen3-Omni-30B는 매우 좋은 결과물을 보여주었지만, 세부 사항(Granularity)은 약간 덜했습니다. 저는 옴니모달(Omni-modal) 학습이 오디오와 비디오를 처리하는 유연성을 얻는 대신, 순수 시각적 선명도(Vision sharpness)를 약간 희생하는 것이라고 추측합니다. 일부 사용 사례에서는 공정한 트레이드오프(Trade-off)입니다.
Hunyuan-Vision은 실망스러웠습니다. 상점의 텍스트나 멀리 있는 보행자 같은 작은 디테일들을 지속적으로 놓쳤습니다. $1.20/M의 비용이라면 더 나은 성능을 기대했을 것입니다.
GLM-4.5V는 적절했습니다. 훌륭하지는 않았지만, 적절했습니다. 무언가를 놓치기도 했고 설명도 빈약했습니다. 하지만 — 여기서 중요한 점은 — $0.01/M이라는 가격에서는 사용 사례에 따라 "적절함"만으로도 충분할 수 있다는 것입니다. 제가 실제로 언제 이것을 사용할 수 있을지는 나중에 설명하겠습니다.
테스트 2: 언어 간 OCR (OCR Across Languages)
문서 추출(Document extraction)은 저희에게 수익이 발생하는 지점입니다. 저희의 전체 파이프라인은 원래 OCR 정확도를 중심으로 구축되었기에, 이것이 제가 가장 신경 썼던 테스트였습니다.
저는 모든 모델에 혼합 언어 문서를 던져주었습니다. 영어 헤더, 중국어 본문, 몇몇 일본어 주석, 그리고 제정신이라면 일부러 설계하지 않았을 법한 복잡한 표가 포함된 문서였습니다.
Qwen3-VL-32B는 세 언어 모두 깔끔하게 처리했습니다. GLM-4.6V는 중국어에서 마찬가지로 강력했으나, 영어에서는 약간 약했습니다. 만약 중국어 비중이 높은 문서를 처리한다면, GLM-4.6V가 Qwen 모델들과 대등하거나 더 나은 성능을 보입니다. 혼합된 워크로드(Workload)의 경우에는 Qwen3-VL-32B가 더 안전한 선택입니다.
Hunyuan-Vision은 여기서 저를 놀라게 할 정도로 성능이 떨어졌습니다. 영어 OCR 성능이 눈에 띄게 약했는데, 100만 토큰당 1.20달러인 모델치고는 이상한 결과였습니다. 그 순간 저는 이 모델을 프로덕션 스택(Production stack)에 포함시키지 않기로 결정했습니다.
테스트 3: 차트 및 다이어그램 (Charts and Diagrams)
지난 분기에 한 고객이 업로드된 차트에서 구조화된 데이터(Structured data)를 추출해 달라고 요청했습니다. 저는 이것이 쉬울 것이라고 생각했지만, 그렇지 않았습니다.
Qwen3-VL-32B는 데이터 추출을 완벽하게 수행했을 뿐만 아니라, 실제로 유용한 트렌드 분석까지 제공했습니다. 단순히 "선이 상승함"이라고 하는 대신 "3분기는 주로 APAC 부문에 의해 23% 증가를 보임"과 같은 식입니다. 이는 다운스트림 LLM(Downstream LLM)에 전달하여 일관성 있는 결과물을 얻을 수 있는 수준의 출력값입니다.
GLM-4.6V도 근소한 차이로 뒤를 이었습니다. Qwen3-Omni-30B 역시 근소했습니다. 여기서 상위 3개 모델 간의 격차는 OCR 테스트 때보다 작았는데, 이는 차트 이해가 미세한 텍스트 인식보다는 패턴 매칭(Pattern-matching)에 가깝다는 점을 고려하면 타당한 결과입니다.
테스트 4: 코드 스크린샷 → 코드 (Code Screenshot → Code)
이 테스트는 개인적인 호기심에서 시작되었습니다. 저는 이상한 들여쓰기와 일부 유니코드 연산자가 포함된 파이썬(Python) 코드 조각을 스크린샷으로 찍은 뒤, 각 모델에게 이를 다시 코드로 변환해 달라고 요청했습니다.
Qwen3-VL-32B는 95%의 정확도를 기록했습니다. 들여쓰기를 처리하고, 특수 문자를 인식했으며, 심지어 저의 일관성 없는 공백까지 파악해 냈습니다. 이는 "스크린샷을 gist로" 변환하는 도구로서 프로덕션에 바로 적용 가능한 수준입니다.
Qwen3-Omni-30B는 눈에 띄는 지연 시간과 함께 92%의 정확도를 기록했습니다. 90%를 기록한 GLM-4.6V는 포맷팅(Formatting) 정리 작업이 일부 필요했습니다.
오디오 문제 (The Audio Question)
아키텍처 관점에서 보면 여기서부터 흥미로운 지점이 발생합니다. 이 라인업 중에서 오직 Qwen3-Omni-30B만이 오디오 입력(Audio input)을 지원합니다. 만약 음성-텍스트 변환 (Speech-to-text), 오디오 질의응답 (Audio Q&A), 감정 감지 (Emotion detection), 또는 "이 녹음에서 무슨 일이 일어나고 있는가"와 같은 기능이 필요하다면, 저렴한 계층(Cheap tier)에서는 이것이 유일한 선택지입니다.
저는 이를 고객 지원 통화 녹음 파일로 테스트했습니다. 전사 (Transcription) 성능은 여러 언어에 걸쳐 매우 뛰어났습니다. 오디오 질의응답 (Audio Q&A)도 작동했습니다. 감정 감지 (Emotion detection)는... 존재하기는 했습니다. 인상적이지는 않았지만, 존재는 했습니다. 음악 묘사 (Music description)는 기본적인 수준이었습니다.
저에게 전략적인 질문은 이것이었습니다: 별도의 오디오 파이프라인 (Audio pipeline)을 구축할 것인가, 아니면 모든 것에 옴니 모델 (Omni model)을 사용할 것인가? 답은 "예"였습니다. 모든 것에 옴니 모델을 사용하는 것입니다. 왜냐하면 100만 토큰당 0.52달러($0.52/M)라는 가격에서, 오디오 기능을 위해 프리미엄을 지불하는 것이 두 개의 파이프라인을 유지 관리하는 비용보다 정당화되지 않기 때문입니다. 운영 복잡성 세금 (Operational complexity tax)이 토큰당 세금 (Per-token tax)보다 더 해롭습니다.
저희의 통합 (Integration) 방식은 대략 다음과 같습니다:
from openai import OpenAI
client = OpenAI(
...
그게 전부입니다. OpenAI SDK와 동일한 인터페이스를 사용합니다. 이것이 핵심입니다. 서비스 레이어 (Service layer)를 다시 작성하지 않고도 모델을 교체할 수 있다는 점은, 정확도의 마지막 5%를 쥐어짜는 것보다 더 가치가 있습니다.
내 마음을 바꾼 가격 계산법
실제 숫자를 대입해 보겠습니다. 누군가 왜 매출원가 (COGS)가 이렇게 낮은지 물었을 때 이사회 보고서 (Board deck)에 넣을 법한 그런 숫자 말입니다.
| 모델 | $/M 출력 (Output) | 1,000개 이미지 분석 | 월간 (10K 이미지) |
|---|---|---|---|
| GLM-4.5V | $0.01 | ~$0.05 | $0.50 |
| ... |
Doubao의 수치는 저희의 실제 성장률에 대입해 투영해 보았을 때 더 이상 이론적인 수치에 머물지 않았습니다. 저희는 엔지니어링 급여에 쓰는 비용보다 비전 추론 (Vision inference)에 더 많은 비용을 지출할 궤도에 올라와 있었습니다. 그것은 이사회 수준의 문제입니다.
동일한 작업량에 대해 월 26달러($26/month)인 Qwen3-VL-32B는 5.7배의 비용 절감을 가져옵니다. 저희 테스트에서 정확도 차이는 저희의 사용 사례(Use case)에서 무시할 수 있는 수준이었습니다. 실제로 여러 작업에서 더 비싼 옵션들을 능가하기도 했습니다.
월 $0.50의 GLM-4.5V는 진심으로 놀라운 수준입니다. 하지만 저희의 요구사항을 충족하기에는 아직 프로덕션 단계(production-ready)에 적합하지 않습니다. 제가 실제로 이 모델을 사용할 곳은 다음과 같습니다: 중요한 부분집합(subset)에 대해 두 번째의 더 높은 품질을 가진 모델을 실행할 예정인 대량 전처리(bulk pre-processing) 작업, 또는 "충분히 괜찮은" 수준이면 되는 낮은 위험도의 애플리케이션(low-stakes applications) — 콘텐츠 모더레이션(content moderation) 대기열, 기본적인 태깅(tagging) 같은 것들입니다.
아키텍처 결정 (The Architecture Decision)
결과적으로 저희는 많은 팀이 공감할 만한 계층형 설정(tiered setup)을 구축하게 되었습니다:
- 기본 비전 워크호스 (Default vision workhorse): Qwen3-VL-32B. $0.52/M, 전반적인 정확도가 가장 뛰어나며, 32K 컨텍스트(context)로 대부분의 문서를 처리할 수 있습니다.
- 오디오 + 멀티모달 에지 케이스 (Audio + multimodal edge cases): Qwen3-Omni-30B. 가격은 동일하며, 오디오/비디오 기능이 추가됩니다.
- 중국어 문서 (Chinese-language documents): GLM-4.6V. 중국어 OCR 정확도 향상을 위해 30%의 프리미엄을 지불할 가치가 있습니다.
- 대량 분류 및 사전 심사 (Bulk triage and pre-screening): GLM-4.5V. 빠른 Yes/No 판단만 필요한 90%의 사례를 위해 $0.01/M에 사용합니다.
계층화 로직은 라우터 서비스(router service)에 구현되어 있습니다. 이미지가 입력되면 시간이 지남에 따라 튜닝한 휴리스틱(heuristics)을 기반으로 모델이 출력됩니다. 이는 유연성을 유지할 수 있게 해주는 방식입니다. 더 나은 모델이 출시되거나 가격 정책이 변할 때, 저희는 설정 파일 하나만 변경하여 재배포하면 됩니다. 벤더 종속성(vendor lock-in)이 없습니다.
ROI와 진짜 질문 (ROI and the Real Question)
지난달 CEO께서 제가 이 작업에 쏟은 3주간의 ROI(투자 대비 효율)가 무엇인지 물으셨습니다. 저는 다음과 같이 답변했습니다: 저희는 연간 예상 추론(inference) 비용을 5자리 수(만 달러 단위) 수준에서 제 개인 예산으로도 감당할 수 있는 수준으로 절감했습니다. 또한 이전에는 구축할 여력이 없었던 오디오 및 비디오 기능에 접근할 수 있게 되었습니다. 그리고 선택권(optionality)을 확보했습니다. 즉, 모델을 교체하는 데 몇 달이 아닌 몇 주면 충분한 능력을 갖추게 된 것입니다.
그것이 바로 ROI입니다. 비용 효율성(cost-effectiveness)은 단순히 가장 저렴한 옵션을 선택하는 것이 아닙니다. 규모가 커짐에 따라 비용이 기하급수적으로 늘어나지 않는 옵션을 선택하는 것이며, 마음을 바꿀 수 있는 능력을 유지하는 것입니다. 저렴하지만 종속되는 옵션은, 약간 더 비싸더라도 이식성(portable)이 있는 옵션보다 장기적으로 더 많은 비용이 드는 경우가 많습니다.
벤더 종속성 함정 (The Vendor Lock-In Trap)
이 부분은 제가 가장 자주 목격하는 실수이기 때문에 특별히 짚고 넘어가고 싶습니다. 한 팀이 특정 API 제공업체를 선택하고, 그들의 SDK, 인증 (Auth), 응답 형식 (Response format), 속도 제한 (Rate limit) 의미론에 맞춰 전체 스택을 구축합니다. 6개월 후, 가격이 변동되거나 더 나은 모델이 출시되면 그들은 꼼짝달싹 못 하게 됩니다. 마이그레이션 (Migration) 비용이 너무 높아서 결국 가격 인상을 그대로 받아들이고 맙니다.
Global API와 같은 통합 게이트웨이 (Unified gateway)를 사용하는 것은 흥미진진한 일이 아닙니다. 데모에서도 눈에 띄지 않습니다. 하지만 이는 6개월 뒤의 당신 자신으로부터 당신을 보호해 줄 아키텍처적 결정 (Architectural decision)입니다. 저는 설정 (Config)에서 문자열 하나만 바꿈으로써 Qwen에서 GLM으로, 혹은 다음에 나올 무엇으로든 전환할 수 있습니다. 이것이 바로 빠른 반복 (Iteration)을 가능하게 하는 유연성입니다.
제가 다른 CTO에게 해줄 말
만약 당신이 오늘 멀티모달 (Multimodal) 프로젝트를 시작한다면, 제가 실제로 권장하는 사항은 다음과 같습니다:
가장 비싼 모델로 시작해서 나중에 최적화하지 마세요. 가장 저렴하고 실행 가능한 모델로 시작하여 유스케이스 (Use case)를 증명하세요. 100만 토큰당 0.01달러인 GLM-4.5V는 예산 회의 없이도 실험할 수 있을 만큼 저렴합니다. 사용자들이 해당 기능을 원한다는 것이 검증되면, 그때 프로덕션 (Production) 버전을 위해 Qwen3-VL-32B에 100만 토큰당 0.52달러를 지불하세요.
하나의 모델을 위해 구축하지 마세요. 모델 인터페이스 (Model interface)를 위해 구축하고, 그 뒤에 모델을 선택하세요. 새로운 제공업체가 절반 가격에 더 나은 모델을 출시했을 때, 미래의 당신이 고마워할 것입니다.
옴니모달 (Omni-modal) 옵션을 무시하지 마세요. 지금 당장 오디오 (Audio)가 필요하지 않더라도, Qwen3-Omni-30B를 기본값으로 설정해 두면 다음 분기에 새로운 통합 (Integration) 작업 없이도 오디오 기능을 출시할 수 있습니다.
이러한 비교를 직접 해보고 싶다면, Global API를 통해 하나의 엔드포인트 (Endpoint)로 이 모든 모델에 접근할 수 있습니다. 저는 말 그대로 모델 문자열만 교체하면 다른 제공업체를 사용하게 됩니다. 인증, SDK, 모든 것이 동일합니다. 추론 (Inference) 비용이 여러분의 런웨이 (Runway)를 갉아먹지 않도록 관리하고 싶다면 확인해 보세요. 이것은 우리가 멀티모달 스택 전체를 생각하는 방식에 있어 게임 체인저 (Game-changer)였습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기