2026년의 음성-텍스트 변환 (Speech-to-Text) API: 가격 페이지가 알려주지 않는 것들
요약
2026년 Speech-to-Text(STT) API 시장의 기술 트렌드와 벤치마크 결과를 분석합니다. 단순 정확도(WER)를 넘어 실시간 스트리밍, 배치 전사, 핵심 용어 프롬프팅(Keyterm Prompting)의 중요성을 강조합니다.
핵심 포인트
- Speech-to-Text는 배치, 실시간 스트리밍, TTS의 세 가지 작업으로 구분됨
- Speechmatics Melia-1이 낮은 WER과 뛰어난 코드 스위칭 능력으로 1위 기록
- 정확도 점수보다 고유 명사 인식을 위한 핵심 용어 프롬프팅 기능이 더 중요할 수 있음
- 오픈 소스 Whisper의 initial_prompt를 활용해 어휘 오류를 쉽게 해결 가능
저는 GPU도 없고 API 키도 없는 CPU 환경에서 faster-whisper를 사용하여 9초 길이의 WAV 파일을 실행해 보았습니다. 실행에는 0.6초가 걸렸고, 단 한 단어만 틀렸습니다: "DevToolLab" 대신 "Dev Tulab"이라고 인식했습니다. 어휘 힌트(vocabulary hinting)를 한 줄 추가하는 것만으로 무료로 이 문제를 해결했습니다. 저는 호스팅형 및 오픈 음성-텍스트 변환 (Speech-to-text) API에 대한 전체 비교를 DevToolLab에 작성했습니다. 여기는 요약 버전입니다.
하나의 명칭, 세 가지의 서로 다른 작업
"음성-텍스트 변환 (Speech-to-text)"은 실제로는 세 가지 별개의 문제를 다룹니다. 배치 전사 (Batch transcription) (이미 디스크에 있는 파일이며, 지연 시간(latency)은 중요하지 않고 시간당 비용과 전문 용어 정확도가 중요한 작업). 음성 에이전트를 위한 실시간 스트리밍 (Real-time streaming) (여기서 어려운 점은 전사 내용이 아니라, 발화자가 말을 잠시 멈춘 것인지 아니면 말을 끝낸 것인지 아는 것과 같은 발화 종료 감지(turn detection)입니다). 그리고 텍스트-음성 변환 (Text-to-speech), 즉 답변을 다시 오디오로 바꾸는 작업입니다.
한 가지 작업에 가장 적합한 모델이 다른 작업에는 잘못된 선택이 되는 경우가 많습니다. 깨끗한 데이터 기반의 배치 정확도에 맞춰 조정된 모델은 전화 에이전트를 구동하기에 적합하지 않으며, 가장 빠른 스트리밍 모델이 2시간짜리 증언 녹취록을 전사하기에 적합한 모델도 아닙니다.
2026년 실제 정확도의 위치
2026년 7월, 14개의 상용 모델을 대상으로 한 벤치마크 결과, Speechmatics Melia-1이 6.4%의 종합 단어 오류율 (Word Error Rate, WER)로 1위를 차지했으며, AssemblyAI Universal-3.5 Pro가 7.0%로 그 뒤를 바짝 쫓았고, Deepgram Nova-3는 8.9%를 기록했습니다. Melia의 진정한 강점은 점수가 아니라 코드 스위칭 (Code-switching) 능력입니다. 언어 힌트 없이도 단 한 번의 통과(single pass)로 56개 이상의 언어를 처리하므로, 스페인어로 시작해 영어로 끝나는 문장도 경계 부분에서 엉키지 않고 정확하게 출력됩니다. 또한 시간당 0.129달러부터 시작하는 가격으로, 자신이 이긴 경쟁사들보다 저렴합니다.
상위 호스팅 제공업체 간의 정확도 격차는 WER 기준 약 2.5포인트로 좁혀졌으며, 이는 깨끗한 오디오와 노이즈가 있는 오디오 사이의 격차보다 작습니다. 대부분의 앱에서 이는 더 이상 정확도 하나만으로 공급업체를 결정해서는 안 된다는 것을 의미합니다.
실제로 중요한 기능: 핵심 용어 프롬프팅 (Keyterm Prompting)
만약 귀하의 제품이 고유한 어휘, 제품명, SKU(Stock Keeping Unit), 약품명 등을 가지고 있다면, 이는 미세한 정확도 점수보다 우선적으로 고려해야 할 기능입니다. AssemblyAI의 Universal-3.5 Pro는 최대 1,000개의 핵심 용어(keyterms)를 수용하여 전사(transcription) 과정에서 이를 우선시하도록 편향(bias)을 줄 수 있습니다:
import assemblyai as aai
aai.settings.api_key = "YOUR_API_KEY"
...
이에 상응하는 오픈 소스(open-source) 방식은 Whisper의 initial_prompt 인자이며, 이는 위 테스트에서 "Dev Tulab"을 "DevToolLab"으로 바꾼 바로 그 부분입니다. 어떤 방식이든, 어휘 힌트를 주는 한 문장은 WER(Word Error Rate)을 1점 개선하기 위해 공급업체를 바꾸는 것보다 가치 있는 경우가 많습니다. 가격 추가 옵션과 그것들이 어떻게 비용을 쌓아 올리는지에 대해 더 자세히 다룹니다. 왜냐하면 바로 이 지점에서 청구 금액이 조용히 세 배로 뛰기 때문입니다.
음성 에이전트(Voice Agents)에게는 발화 종료 감지(Turn Detection)가 무엇보다 중요합니다
대부분의 스트리밍 파이프라인(streaming pipelines)은 여전히 침묵 타이머(silence timer)를 사용하여 화자가 말을 마쳤는지 추측하며, 이것이 음성 에이전트가 사람의 말을 끊거나 두 초 동안 어색하게 침묵하는 이유입니다. Deepgram의 Flux는 발화 종료 감지(end-of-turn detection) 기능을 모델 내부로 이동시켜, 사람이 실제로 말을 마쳤는지 여부를 400ms 이내에 결정하고 이를 이벤트(EndOfTurn, 다시 말을 시작할 경우 TurnResumed)로 방출합니다. 전사 정확도가 아무리 높아도 잘못된 발화 교대(turn-taking) 추측을 해결할 수는 없습니다. 이것이 특히 에이전트에게 있어 중요한 단 하나의 아키텍처(architectural) 차이점입니다.
오픈 소스가 격차를 줄였습니다
셀프 호스팅(Self-hosting)은 지난 1년 정도 사이에 더 이상 타협안이 아니게 되었습니다. NVIDIA의 Parakeet TDT 0.6B v3는 A100에서 실시간 대비 3,000배 이상의 처리량(throughput)으로 평균 6.32%의 WER을 달성하며, 이는 약 1초 만에 1시간 분량의 오디오를 처리할 수 있음을 의미합니다. Whisper large-v3는 여전히 어떤 상용 API보다 더 많은 언어(99개)를 지원합니다. Moonshine은 Raspberry Pi와 같은 엣지 디바이스(edge devices)에서 Whisper보다 최대 5배 더 빠르게 작동합니다. 처리량이 많거나 데이터가 민감하다면, 먼저 무료 베이스라인(baseline)을 실행해 보고, 그것보다 성능이 뛰어나다는 것을 확인했을 때만 호스팅 API 비용을 지불하십시오.
실제로 당신을 괴롭히는 것: 정확도가 아닌 과금
가격 페이지에는 명시되지 않지만 비용 모델을 망가뜨리는 두 가지 요소가 있습니다. 첫째, 스트리밍 (Streaming)은 전송된 오디오 양이 아니라 연결이 열려 있는 시간(connection-open time)을 기준으로 과금되는 경우가 있습니다. 따라서 사용자가 페이지를 읽는 동안 유휴 상태(idle)로 열려 있는 WebSocket은 음성을 전달하는 경우와 동일한 비용이 발생합니다. 둘째, 부가 기능 (Add-ons)은 가산적으로 쌓입니다. 화자 분리 (Diarization), 개체 인식 (Entity detection), 주제 탐지 (Topic detection)는 각각 시간당 요금에 5~15센트를 추가할 수 있으며, 이 네 가지를 중첩하면 가장 저렴해 보이는 기본 요금보다 청구 금액이 세 배까지 늘어날 수 있습니다. 헤드라인에 적힌 숫자가 아니라, 실제로 배포할 구성 (Configuration)을 기준으로 가격을 책정하십시오.
References
- Best Speech-to-Text and AI Voice APIs in 2026 (full comparison, pricing tables, and code) - DevToolLab의 원문 기사
- Speechmatics pricing
- AssemblyAI pricing
- Deepgram Flux
- NVIDIA Parakeet TDT 0.6B v3
- 직접 체험해 보기: DevToolLab의 Speech to Text 및 Microphone Test
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기