Speech-to-Text를 직접 호스팅하는 비용: Whisper가 API보다 저렴할까?
요약
Whisper와 같은 오픈 소스 모델을 직접 호스팅하는 것과 AssemblyAI 같은 관리형 API를 사용하는 것의 비용 및 운영 효율성을 비교합니다. 단순 모델 비용 외에 GPU 유휴 비용, 화자 분리, 스트리밍 구현 등 숨겨진 총 소유 비용(TCO)을 분석합니다.
핵심 포인트
- 직접 호스팅 시 GPU 사용량과 관계없이 시간당 비용이 발생함
- 관리형 API는 실제 처리된 오디오 초 단위로 과금되어 효율적임
- 화자 분리(Diarization) 및 스트리밍 구현은 직접 구축 시 높은 공수가 듦
- 단순 모델 비용보다 인프라 운영 및 엔지니어링 비용이 핵심임
Originally published on NextFuture
팀이 이번 달 AssemblyAI 청구서를 계산하고 나서 누군가 물었습니다: 왜 Whisper를 직접 호스팅해서 비용을 절감하지 않느냐고요? 체크포인트는 무료로 다운로드할 수 있고, pip install만 하면 되고, 오디오 파일을 지정하면 됩니다. 그리고 단 하루 만에 끝납니다. 더 정확한 질문은 다음과 같습니다: 그 엔드포인트를 향후 2년 동안 운영하는 데 드는 실제 비용은 얼마일까요?
명시된 가격과 총 소유 비용의 차이점
ASR(자동 음성 인식) 체크포인트—Whisper Large-v3, Parakeet, Voxtral 등—은 전사(transcription) 제품의 일부일 뿐, 전체 제품이 아닙니다. API 관리 서비스에 돈을 지불할 때, 그 비용에는 사용자가 직접 구축해야 할 부분도 포함됩니다: 추론(inference) 인프라, 실제 환경의 잡음 오디오 처리, 화자 분리(diarization), 엔티티 형식 지정(format entity), 스트리밍, 그리고 문제 발생 시 새벽 2시에 대기하는 시간까지입니다. 체크포인트를 다운로드하면 이 모든 것을 한 번에 얻게 됩니다.
AssemblyAI의 셀프 호스팅 비용 비교 기사에 따르면, A100/H100급 온디맨드 GPU는 시간당 약 **$2–4+**가 소요되며, GPU가 오디오를 처리하고 있든 아니든 돈을 지불해야 합니다—GPU의 공 suất이 15%만 사용되더라도 100% 작동하는 것처럼 비용이 청구됩니다. 반면 AssemblyAI와 같은 관리형 API는 실제 처리된 오디오 초당 요금으로 부과되며, 비동기 전사(asynchronous transcription)의 경우 시간당 약 $0.15–$0.21, 스트리밍(streaming)의 경우 시간당 $0.15–$0.45 수준입니다.
빠른 비교표
| 항목 | 직접 호스팅 (Whisper, Parakeet, Voxtral) | 관리형 API (AssemblyAI) |
|---|---|---|
| 모델 비용 | $0 — 오픈 가중치, 라이선스 비용 없음 | 시작은 $0, 이후 사용량에 따라 지불 |
| 실제로 지불하는 것 | GPU 시간(유휴 시간 포함), 엔지니어 및 DevOps 시간 | 실제 오디오만 처리, 초 단위로 계산 |
| 일반적인 운영 비용 | A100/H100급 온디맨드 GPU당 시간당 약 $2–4+, 사용량 무관 | 비동기: 시간당 $0.15–$0.21; 스트리밍: 시간당 $0.15–$0.45 |
| Diarization (화자 분리) | 직접 구축하거나 별도의 모델을 결합해야 함 | 기본 제공, 전사 및 화자가 동시에 생성됨 |
| Streaming (스트리밍) | 낮은 지연 시간의 서빙 레이어 자체 구축 필요 | 원본 스트리밍 API, 약 300ms 간격으로 부분 전사 제공 |
체크포인트 가격에 포함되지 않은 숨겨진 비용
화자 분리 (Diarization, 누가 어떤 말을 하는지)는 대부분의 오픈 소스 체크포인트(checkpoint)에서 기본적으로 제공되지 않습니다. 별도의 모델을 추가로 결합해야 하며, 이 부분은 짧은 발화, 끼어들기, 목소리 겹침과 같이 가장 중요한 지점에서 쉽게 무너지곤 합니다. 스트리밍 (Streaming) 또한 마찬가지입니다. 대부분의 오픈 체크포인트는 비동기 방식으로만 작동하므로, 제품에 실시간성 (real-time, 음성 에이전트, 실시간 자막 등)이 필요하다면 청크 분할 (chunking), 부분 가설 처리 (partial hypothesis processing), 엔드포인팅 (endpointing)을 포함한 스트리밍 레이어 전체를 직접 구축해야 합니다.
개체 정확도 (Entity accuracy)는 가장 간과하기 쉬운 부분입니다. 사용자가 전화로 신용카드 번호, 이메일, 인증 코드를 읽어줄 때 단 한 글자만 틀려도 전사 (transcript) 데이터는 무용지물이 됩니다. 가공되지 않은 체크포인트는 단어들을 전사할 수는 있지만, 전화로 파편화되어 읽어주는 인증 코드 문자열을 자동으로 올바르게 포맷팅해주지는 않습니다. 이 기능을 원한다면 팀이 직접 구축하여 영구적으로 유지보수하거나, 이미 구현된 서비스에 비용을 지불해야 합니다.
새벽 2시에 누가 호출(pager)을 받을 것인가
오후에 진행한 데모는 단일 요청을 처리하는 GPU 하나에서 잘 돌아갔을 것입니다. 하지만 프로덕션 (Production) 환경은 이야기가 다릅니다. 실제 규모에서의 동시성 (concurrency), 재시도 (retry) 및 우아한 성능 저하 (graceful degradation), 다운타임 없는 버전 업그레이드, 업타임 (uptime) 모니터링 등이 필요합니다. 직접 호스팅할 경우, 이러한 운영 영역 전체가 귀하의 팀 책임이 되며 누군가는 반드시 호출 (pager)을 받아야 합니다. 반면, 관리형 플랫폼은 무제한 동시성과 속도 제한 (rate limit) 없는 환경에서 매달 수억 건의 추론 (inference)을 처리하며, 대규모 환경에서의 신뢰성 그 자체를 상품으로 판매합니다.
가장 큰 위험은 실제 오디오에서의 정확도에 있습니다: 차량 내 통화, 여러 명이 동시에 말하는 콜센터 환경, 모델이 접해보지 못한 산업 전문 용어 등이 이에 해당합니다. 바로 이 지점에서 환각 (hallucination) 현상이 나타납니다. 모델이 침묵이나 소음이 발생할 때 단어를 스스로 지어내어, 듣기에는 유창하지만 내용은 완전히 틀린 결과를 내놓는 것입니다. AssemblyAI가 공개한 내부 벤치마크 데이터에 따르면, 그들의 Universal-3 Pro 모델은 자체 테스트에서 Whisper보다 환각 비율이 약 30% 낮았습니다. 다만 이는 벤더 측에서 자체 발표한 수치이며 독립적인 벤치마크가 아니므로, 최종 결론이 아닌 참고용으로 보아야 합니다. 동일한 출처는 구체적인 예시도 제시했습니다: Voxtral Mini는 코드 스위칭 (code-switching, 문장 내 언어 전환) 오디오에서 18%에 가까운 단어 오류율 (word error rate)을 기록한 반면, 그들의 측정 방식에 따른 플래그십 관리 모델은 8% 미만을 기록했습니다.
언제 셀프 호스팅 (self-host)이 올바른 선택인가
셀프 호스팅이 항상 틀린 것은 아닙니다. 셀프 호스팅이 합리적인 세 가지 경우가 있습니다: 모델에 대한 완전한 제어권이 필요한 연구 또는 프로토타입 제작 단계, 지연 시간 (latency)이 중요하지 않고 GPU 사용률을 지속적으로 높게 유지할 수 있는 대규모 오프라인 배치 작업 (batch job) 수행 — 이 시점에는 경제성 문제가 셀프 호스팅에 유리하게 역전됩니다, 또는 데이터가 내부 인프라를 벗어나서는 안 된다는 필수 요구 사항이 있는 경우입니다. 만약 팀이 이 세 가지 경우에 해당하지 않는다면, 모델의 "무료"라는 부분은 로드맵에서 가장 비싼 비용 항목이 될 것입니다. 단지 청구서에 나타나지 않을 뿐입니다.
다음 단계로 해야 할 일
올바른 비교는 모델 가격과 API 가격을 비교하는 것이 아닙니다. 직접 운영하는 데 드는 총 소유 비용 (total cost of ownership, GPU, 엔지니어, 평가 시스템, 온콜 대기 등)과 타사가 운영 책임을 지는 초 단위 과금 청구서를 비교하는 것입니다. 결정을 내리기 전에, 노이즈가 심하거나 방언이 섞여 있고 전문 용어가 많은 가장 까다로운 오디오 데이터셋을 사용하여 두 가지 방식을 모두 테스트해 보십시오. 결정적인 벤치마크는 그 어떤 벤더의 비교 페이지에 적힌 숫자가 아니라, 바로 여러분의 데이터로 직접 확인한 결과여야 합니다.
이 기사는 원래 NextFuture에 게시되었습니다. 더 많은 풀스택 및 AI 엔지니어링 콘텐츠를 보시려면 저희를 팔로우하세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기