2026년 텍스트 음성 변환(TTS) API 분석: 블라인드 테스트 순위와 5백만 문자 비용 실태
요약
본 기사는 텍스트 음성 변환(TTS) API의 실제 사용 시 고려해야 할 품질, 가격 책정 방식, 그리고 프로덕션 문제를 심층 분석합니다. ElevenLabs와 OpenAI 등 주요 공급업체의 최신 업데이트 및 오픈 소스 모델들의 성능을 비교하며, 특히 날짜나 요일 같은 특정 단어 처리 오류를 지적했습니다.
핵심 포인트
- TTS API 선택 시 품질(Elo 등급)과 가격 구조를 모두 고려해야 합니다.
- 대부분의 서비스는 입력 문자열 길이를 기준으로 과금하므로 주의가 필요합니다.
- 오픈 소스 모델들은 요일이나 날짜 같은 특정 단어를 숫자로 잘못 읽는 문제가 발견되었습니다.
- 사전 텍스트 전처리(Pre-processing)를 통해 TTS 오류를 해결할 수 있습니다.
음성 기능을 구축하는 것은 텍스트-음성 변환(text-to-speech) API를 선택하는 것만으로는 쉬워 보입니다. 하지만 청구서가 문자당 과금되고, 사용자는 첫 단어 전의 모든 일시 정지를 알아차리며, 모델은 "Dr."을 자신이 원하는 대로 읽습니다. 저는 현재 품질, 가격 및 프로덕션에서 문제가 되는 지루한 요소들을 비교했으며, 모든 공급업체 스크린샷이 포함된 전체 버전은 DevToolLab의 더 긴 글에 있습니다. 이것이 요약본입니다.
시기가 중요합니다. 시장이 방금 바뀌었기 때문입니다. ElevenLabs는 2026년 9월 28일에 Eleven v4를 출시했으며, 가격은 문자 1,000개당 $0.08입니다. OpenAI는 10월 1일에 /v1/audio/speech 뒤의 모든 모델을 사용 중단(deprecated)했으며, 종료일은 2027년 1월 6일로 설정되었습니다. 그리고 인기 있는 오픈 소스 모델 두 개 모두 테스트했을 때 "Tue."를 숫자 2로 읽었습니다.
순위 및 가격 책정 방식
품질은 Artificial Analysis Voice Arena에서 나옵니다. 청취자들은 어떤 모델이 생성했는지 모른 채 두 클립을 듣고 더 좋은 것을 고르며, 이 투표가 92개 모델에 걸쳐 Elo 등급으로 변환됩니다 (2026년 10월 6일 스냅샷). 같은 사이트에서 진행된 두 번째 테스트는 숫자, 날짜 및 코드의 발음을 점수화합니다.
비용 측면에서는 모든 공급업체가 동일한 작업을 받습니다: 월 5백만 문자 분량의 예약 알림을 보내는 미국 클리닉입니다. 이는 다음과 같은 128자 메시지 약 39,000건의 전화에 해당합니다.
Patel 박사님과의 예약이 10월 13일 화요일 오후 2시 30분으로 확정되었습니다. 본인 부담금은 $45.50입니다. 질문 있으신가요? (555) 010-1234로 전화하세요.
대부분의 공급업체는 입력 문자(input characters)를 기준으로 과금하므로, 사용자의 텍스트 길이가 청구 금액이 됩니다. 일부는 오디오 길이를 추적하는 토큰을 기준으로 합니다. 가격은 2026년 10월 7일 공급업체 페이지에서 확인되었습니다. 먼저 자체 볼륨을 검증하고 싶다면, 문자 카운터에 한 달 분량의 스크립트를 붙여넣으세요. 공백도 포함해야 합니다. 왜냐하면 그것이 청구 대상이기 때문입니다.
"Tue." 문제: 두 개의 오픈 모델, 하나의 알림
저는 그 알림을 M3 Pro MacBook Pro CPU에서 Kokoro-82M 0.9.4와 Piper 1.8.0으로 실행한 다음, faster-whisper 1.2.1 (small.en)로 오디오를 다시 전사하여 청취자가 실제로 무엇을 들을지 확인했습니다.
| 모델 | 워밍업 합성 (Warm synthesis) | 오디오 | 실시간 계수 (Real-time factor) | 들리는 대로 (Heard as) |
|---|---|---|---|---|
Kokoro-82M (af_heart) | 1.52 s | 14.22 s | 0.107 | "confirmed for 2. Oct. 13", "Call 555-1012-34" |
Piper (en_US-lessac-medium) | 0.347 s | 13.66 s | 0.025 | "confirmed for 2.00. Oct. 13", "Call 555-010-1234" |
두 모델 모두 요일을 숫자로 처리했으며, Kokoro는 전화번호를 아무도 다이얼할 수 없는 무작위 조합으로 만들었습니다. 합성 전에 작은 텍스트 처리를 거치자 두 문제 모두 해결되었습니다:
import re
DAYS = {"Mon": "Monday", "Tue": "Tuesday", "Wed": "Wednesday", "Thu": "Thursday",
...
See Doctor Patel Tuesday, October 13 at 2:30 PM. Call 5 5 5, 0 1 0, 1 2 3 4.
정규화(normalizing) 후 두 모델 모두 "Tuesday, October 13"과 다이얼 가능한 번호를 반환했습니다. 호스팅된 모델들도 예외는 아닙니다: Eleven v4는 발음 테스트에서 91.7 퍼센트를 기록했고 Cartesia Sonic 3.6은 74.5 퍼센트를 기록했습니다.
ElevenLabs: 1위와 2위
Eleven v4 Turbo가 1334 Elo로 아레나의 정상에 자리했으며, Eleven v4는 그 바로 뒤인 1321을 차지했습니다. 두 모델 모두 90개 이상의 언어와 음성 클로닝(voice cloning)을 지원하며, 발음 테스트에서는 각각 90.1퍼센트와 91.7퍼센트로 선두를 달렸습니다. ElevenLabs는 v4 Turbo의 중앙 추론 시간(median inference)이 자체 서버에서 측정되었으며 네트워크 연결 시간을 제외하고 약 100ms라고 언급했습니다.

단점은 비용입니다. v4의 리스트 가격은 1,000자당 $0.08이고, v4 Turbo와 Flash v2.5는 1,000자당 $0.04이므로, 클리닉 작업 부하는 v4에서 $400, Turbo에서 $200으로 운영됩니다.
Alibaba Qwen-Audio TTS
Qwen-Audio-3.1-TTS-Plus는 1292 Elo로 3위를 차지했고, 3.0-TTS-Plus는 1261 Elo로 6위에 올랐습니다. 미국 팀에게 실질적인 장애물은 배포와 가격 책정입니다: Model Studio에는 Beijing과 Singapore만 나열되어 있고 US 지역이 없으며, 국제 가격표는 3.0을 다루지만 아직 3.1은 아닙니다. 3.0 Plus는 싱가포르에서 10,000 문자당 $0.20입니다 (Flash는 $0.15). 이로 인해 작업 부하 비용은 $100이 됩니다.
Cartesia Sonic-3.6
1278 Elo의 4위를 차지했으며, 44개 언어를 지원하고 광고된 지연 시간(latency)은 90ms 미만입니다. 제가 가장 마음에 들었던 세부 사항은 모델 고정(model pinning) 기능입니다: sonic-3.6은 최신 안정 스냅샷을 따르며, sonic-3.6-YYYY-MM-DD는 사용자 환경에서 절대 변경되지 않습니다. 단점으로는 발음 정확도가 74.5%를 기록했고, Free부터 Scale까지 동시성(concurrency) 제한이 각각 2, 3, 5, 15 요청으로 설정되어 있다는 점입니다.
Startup은 크레딧 125만 개에 월 $49이며, 초과분은 백만 개당 $45입니다. Scale의 경우 8백만 개에 $299입니다. 이로 인해 작업 부하 비용은 Startup 기준으로 $217.75가 됩니다.
주요 클라우드 제공업체 (The big clouds)
Google, Amazon, Microsoft는 쉽게 도입할 수 있는 선택지이지만, 저렴한 음성 모델들은 순위표에서 상당히 낮은 곳에 위치합니다. Google의 Gemini 3.8 Flash TTS가 예외적으로 5위를 차지했습니다 (1275 Elo, 발음 정확도 89.5%). 이 서비스는 2026년 12월 31일까지 텍스트 토큰 백만 개당 $0.50, 오디오 토큰 백만 개당 $9로 청구되며, 2027년 1월 1일부터는 두 배가 됩니다. Chirp 3 HD 음성은 백만 문자당 $30으로 58위를 차지하며, 첫 백만 문자는 매달 무료입니다.
Amazon Polly는 생성형(Generative) 음성 모델의 경우 백만 문자당 $30을, 신경망(Neural) 음성의 경우 $16을 청구합니다 (92개 중 90위). Azure AI Speech는 East US 지역에서 Neural HD가 백만 문자당 $22 (28위), Neural이 백만 문자당 $15 (68위)입니다.
Inworld TTS-2
1251 Elo로 7위를 차지했으며, 더 저렴한 TTS-2 Flash는 12위를 차지했습니다. 이 서비스를 고려해야 하는 이유는 마이그레이션(migration) 때문입니다: Inworld는 OpenAI의 POST /v1/audio/speech 요청 형식을 구현하고 있으므로, OpenAI에서 벗어난다는 것은 SDK를 https://api.inworld.ai/v1로 지정하고 모델 이름을 inworld-tts-2로 변경하는 것을 의미합니다.
TTS-2는 온디맨드(on demand) 기준 백만 문자당 25달러이며, $100 빌더 플랜에서는 17.50달러입니다. Flash는 온디맨드 기준 15달러, 빌더 플랜에서 9달러입니다. 워크로드는 온디맨드 기준 125달러이거나, 빌더 비용인 $100을 지불해야 합니다.
Speechify Simba 3.2
Speechify의 개발자 API는 리더 앱과는 별도로 청구되며, 1242 Elo로 8위에 랭크되었고, 상위 10개 중 가장 낮은 공개 셀프 서비스(self-serve) 문자당 요율을 가지고 있습니다: Starter 플랜은 백만 문자당 10달러, Pro는 8달러, Scale은 6달러입니다. Speechify에 따르면 Coval에서 독립적인 첫 오디오 시간은 106ms, Voice Arena에서는 123ms입니다.

단점은 언어입니다. 셀프 서비스 계정의 경우 Simba 3.2에서는 영어만 제공되고, 구 버전인 Simba 3.0에서는 6개 언어를 제공합니다. Starter 플랜은 월 10달러에 190만 문자가 포함되어 있어, 워크로드는 41달러가 발생합니다.
MiniMax, Fish Audio 그리고 긴 꼬리(long tail)
MiniMax Speech 2.8 HD는 19위에 랭크되었으며, 백만 문자당 100달러(Turbo의 경우 60달러)로 가장 비쌉니다. 따라서 워크로드는 500달러가 발생합니다. 이 서비스는 장문 지원(비동기 요청당 최대 1백만 문자)과 1.50달러의 빠른 음성 클론 기능을 통해 높은 점수를 받았습니다.
Fish Audio S2.1 Pro는 24위에 랭크되었으며, 구독료 없이 백만 UTF-8 바이트당 15달러를 청구합니다. 일반 영어 텍스트의 경우 워크로드가 약 75달러 정도 나오지만, 악센트가 있거나 CJK(중국어, 일본어, 한국어) 텍스트는 문자당 더 많은 바이트를 사용하고 비용이 더 많이 듭니다.
Deepgram은 이 목록에 없지만, Flux TTS(2026년 8월 12일 출시)는 전체 통화 내용을 문맥으로 유지하고, 발신자가 말을 끊었을 때 실제로 들었던 내용을 보고하며, 자체 호스팅이 가능합니다. Aura-2는 1,000 문자당 0.030달러이며 Flux TTS는 0.045달러입니다. Rime은 Coda(55위)의 경우 1,000 문자당 0.05달러, Mist v3의 경우 0.03달러를 청구합니다. Hume의 Octave 2는 61위에 랭크되었지만, 현재 가격 페이지가 홈페이지로 리디렉션되므로 영업 견적(sales quote)이 필요합니다.
OpenAI의 음성 엔드포인트는 종료일이 있습니다
OpenAI의 폐기(deprecation) 페이지에는 tts-1, tts-1-hd와 gpt-4o-mini-tts 스냅샷 두 가지가 2027년 1월 6일에 종료된다고 명시되어 있으며, 대체 모델로 gpt-realtime-2.1-mini를 제시하고 있습니다.

이 대체 모델은 Realtime API 방식이기 때문에, REST 호출을 WebSocket 또는 WebRTC 세션으로 전환해야 하며, 비용은 오디오 출력 토큰 1백만 개당 $20입니다. tts-1은 종료 시점까지 문자 1백만 개당 $15를 유지합니다. 만약 오늘 구형 엔드포인트를 사용하고 있다면, Inworld의 호환 API가 가장 적은 코드 변경으로 대응할 수 있습니다.
오픈 가중치 및 라이선스
자체 모델을 운영하는 것은 문자당 비용 지불 방식을 인프라 구축 비용으로 대체하며, 어떤 라이선스를 사용하느냐에 따라 배포 가능한 범위가 결정됩니다. Kokoro-82M (54위)은 Apache 2.0입니다. Piper는 제 CPU에서 실시간보다 40배 빠르게 작동했지만, 원래 MIT 저장소는 2025년 10월 6일에 아카이브되었으며, 작업은 GPL-3.0 하의 piper1-gpl로 계속되고 있습니다. Resemble AI의 Chatterbox는 MIT 라이선스이며, Canopy Labs의 Orpheus는 Apache 2.0입니다.
가장 높은 순위의 오픈 가중치 모델인 Breeze TTS 2 (11위)와 Fish Audio의 S2 Pro는 연구용 및 비상업적 용도로만 사용 가능합니다. 또한 Kokoro와 Piper 모두 GPL-3.0인 espeak-ng를 가져온다는 점에 유의해야 합니다. 원래 게시물에는 제가 espeak-ng를 로드하는 데 필요한 macOS 수정 사항과 모든 15개 항목을 포함한 전체 나란히 비교 테이블이 있습니다.
간편 비교
| API | Arena 순위 | 문자당 비용 (1M) | 월 5M 문자 비용 |
|---|---|---|---|
| ElevenLabs v4 Turbo | 1 | $40 | $200 |
| ... |
- 실제 문자 수 측정. SSML을 포함하여 실제로 합성한 한 달 분량을 내보낸 다음, 위의 요율로 곱하세요.
- 정규화 후 비교. 가장 어려운 50개 문구(순서 번호, 약물 이름, 코드 등)를 위와 같은 방식으로 텍스트 처리하고 각 후보군을 거친 다음, 오디오를 다시 전사해 보세요.
- 자신의 지역에서 첫 번째 오디오 바이트 시간 측정. 대부분의 미국 스택에 사용되는
us-east-1과 같이, 공급업체의 지연 시간은 그들 측에서 측정되기 때문입니다. - 탈출구를 남겨두세요. 존재하는 경우 날짜가 지정된 모델 스냅샷을 고정하고, 다음 전환이 설정 변경만으로 가능하도록 OpenAI와 호환되는 엔드포인트나 오픈 웨이트(open weights)를 선호하세요.
아무것도 지불하기 전에, 브라우저 내장 음성 기능을 사용하여 Text to Speech tool에서 정규화된 스크립트를 들어볼 수 있습니다.
제가 추천하는 제품들 (My picks)
- 가장 인간적인 목소리 에이전트: ElevenLabs v4 Turbo, 1,000 문자당 $0.04로 순위표에서 가장 앞선 제품입니다.
- 달러 대비 최고의 품질: Speechify Simba 3.2, 영어만 커버하면 이 워크로드에 대해 $41로 순위표의 여덟 번째 제품입니다.
- 여전히 OpenAI 음성 엔드포인트 사용: 2027년 1월 6일 이전에 마이그레이션하고 Inworld TTS-2를 먼저 살펴보세요.
- 클라우드 계약에 종속된 경우: Azure Neural HD는 $22로, Azure Neural보다 40단계 높은 순위를 차지합니다.
- 네트워크 외부로 나갈 수 없는 데이터: Apache 2.0 기반의 Kokoro, GPL-3.0이 적합하다면 Piper, 또는 Deepgram Flux TTS 자체 호스팅(self-hosted).
가격 차이가 품질 차이보다 훨씬 큽니다. Simba 3.2는 같은 워크로드에 대해 Eleven v4 비용의 약 1/10 수준인 여덟 번째 순위를 차지하며, Kokoro는 노트북 CPU에서 실시간보다 약 9배 빠르게 작동합니다. 전념하기 전에, 자신의 지역에서 가장 어려운 문구를 세 가지 후보군으로 정규화하여 들어보세요.
참고 자료 (References)
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기