Open TTS 리더보드: 다국어 텍스트-음성 변환 및 음성 복제에 대한 확장 가능한 평가
요약
본 기사는 오픈 소스 TTS 모델의 평가 표준화 필요성을 제기하며, 기존의 인간 선호도 기반 리더보드(아레나 스타일)의 한계를 지적합니다. 이에 따라 명료성(WER/CER), 속도(RTFx/TTFA), 화자 유사성(SIM) 등 객관적인 지표를 활용한 Open TTS Leaderboard를 제안했습니다.
핵심 포인트
- 오픈 소스 TTS 모델은 평가 표준화가 시급합니다.
- 기존 아레나 방식은 확장성과 일관성 측면에서 한계가 있습니다.
- 객관적 지표(WER, RTFx, SIM) 사용으로 평가 시간이 단축됩니다.
- 제안된 리더보드는 커뮤니티 주도 방식으로 운영될 예정입니다.
요약 👉 오픈 소스 및 다국어에 중점을 둔 새로운 TTS 리더보드
오픈 소스 텍스트-음성 변환(TTS) 모델의 출시 속도는 놀라울 정도입니다. Hugging Face Hub(2026년 9월 30일 기준)에는 8,000개 이상의 TTS 모델이 이용 가능합니다 🚀하지만 평가는 그 속도를 따라가지 못했습니다: 여전히 파편화되어 있고 표준화되지 않았습니다. 황금 표준은 MOS 또는 MUSHRA와 같은 인간 선호도 점수입니다(지표에 대한 내용은 더 자세히 다룹니다). 이를 위해 여러 아레나 기반 리더보드가 커뮤니티의 유용한 참고 지표로 자리 잡았습니다:
이러한 아레나는 사용자에게 두 모델의 TTS 출력을 제시하고 어느 쪽을 선택할지 묻는 방식으로 모델을 비교합니다. 충분한 수의 투표를 수집한 후, 일반적으로 Bradley–Terry 모델(Voice Arena 방법론 참조)을 사용하여 Elo 점수가 계산되어 모델 순위가 매겨집니다.
인간 선호도가 궁극적인 결정 요소이지만, 아레나는 TTS 출시 속도를 따라잡기에는 확장성이 부족합니다. 이것이 오픈 소스 모델이 아레나 스타일 리더보드에서 과소 대표되는 이유일 수 있습니다. 2026년 9월 30일 기준으로 Artificial Analysis의 92개 모델 중 오픈 가중치(open-weights)는 16개에 불과하며, Voice Arena도 비슷한 경향을 보입니다. 이는 아마도 실질적인 요인을 반영하는 것 같습니다: API 모델을 추가하려면 API 키만 있으면 되지만, 오픈 모델은 아레나 운영자에 의해 호스팅되고 제공되어야 하며, 상업적 공급자가 오픈 소스 작가보다 입지를 찾으려는 이유가 더 많습니다. 아레나 스타일 평가의 또 다른 한계는 투표자 일관성입니다: 어떤 아레나도 동일한 기준의 '더 나은' 모델을 시간이 지남에 따라 꾸준히 평가할 수 있는 동일한 투표자를 보장할 수 없습니다. 심지어 한 사람의 선호도는 시간이 지나면서 변합니다(
명료성(Intelligibility): 프롬프트와 생성된 오디오의 전사본 간의 단어/문자 오류율(WER 및 CER)을 사용하며, Qwen3 ASR(Open ASR Leaderboard에서 최고 순위의 오픈 소스 모델)로 측정합니다.속도(Speed): H200 GPU에서의 배치형 오프라인 추론에 대한 역 실시간 계수(RTFx)와 H200 GPU 및 CPU에서의 스트리밍 배치 크기 1 지연 시간을 정량화하는 시간-최초-오디오(TTFA)를 사용합니다.화자 유사성(Speaker similarity): 생성된 오디오의 WavLM 화자 임베딩과 참조 클립 간의 코사인 유사도(SIM)를 계산하여 측정합니다.
객관적인 지표에 의존함으로써 모델 평가 시간이 몇 주에서 몇 시간으로 단축됩니다 ⚡
중요하게도, Open TTS Leaderboard는 인간 선호도 순위를 대체하지 않습니다. ASR 기반 WER은 명료성의 대리 지표를 제공하며, 화자 유사성은 음성 정체성 보존을 추정합니다. 어느 것도 자연스러움(naturalness), 표현력(expressiveness) 또는 청취자 선호도를 직접 측정하지는 않습니다. 그럼에도 불구하고, 이들은 투표 기반 리더보드가 평가에 포함할 모델을 결정하는 데 도움을 줄 수 있습니다.
이 리더보드를 만든 우리의 의도는 커뮤니티가 주도하도록 하는 것입니다. 평가가 관련성 있고 통찰력 있게 유지되도록 여러분의 피드백을 듣고 싶습니다. 다음 몇 섹션에서 Open TTS Leaderboard의 주요 기능을 개괄적으로 설명합니다.
리더보드의 기본 보기에서는 Seed TTS Eval(논문) 및 CV3 Eval(제로샷)(논문)의 영어 분할에 대한 거시 평균 WER로 모델이 순위가 매겨집니다.



hexgrad/Kokoro-82M, Supertone/supertonic-3, 그리고 fishaudio/s2-pro가 이 두 분할에서 평균화된 영어 WER 부문에서 선두를 차지하며, 파레토 플롯은 WER, 배치 추론(RTFx), 및 크기 사이의 좋은 균형을 이루는 모델을 시각화합니다.
영어 성능이 반드시 다른 언어에도 적용되는 것은 아닙니다. 여러 언어를 전환하여 모델의 다국어 성능 순위를 매길 수 있습니다. Seed TTS Eval은 영어와 중국어 오디오만 가지고 있으므로, 다른 언어는 CV3 Eval 점수(제로샷)를 사용합니다. 참고로 중국어, 일본어, 한국어는 문자 기반 언어이므로 문자 오류율(CER)이 보고되며, 언어 전반의 “평균 WER”은 언어별 매크로 평균입니다.

k2-fsa/OmniVoice, fishaudio/s2-pro, 그리고 FunAudioLLM/Fun-CosyVoice3-0.5B-2512는 강력한 다국어 모델들입니다.
“음성 복제(Voice cloning)”를 전환하여 이 기능을 지원하는 모델들(선택된 언어에서)을 비교할 수 있습니다.
더 나아가, 테이블에 화자 유사도(SIM) 열이 추가되었으며, SIM, 배치 추론(batched inference), 크기 간의 트레이드오프를 시각화하기 위한 두 개의 파레토 플롯이 더 제공됩니다.


bosonai/higgs-tts-3-4b 및 openbmb/VoxCPM2와 같은 일부 모델의 평균 WER은 음성 복제, 즉 참조 오디오가 제공될 때 개선되는 것을 확인할 수 있습니다.
수치만으로는 전체 이야기를 다 할 수 없으며, 앞서 언급했듯이 인간의 선호도가 궁극적인 결정 요소입니다. “청취(Listen)” 탭에서 지표 뒤에 숨겨진 생성된 출력을 비교하여 어떤 모델을 선호하는지 찾으실 수 있습니다!
관심 있는 언어/데이터셋을 선택하고, 음성 복제를 비교하고 싶다면 선택하거나, 옵션으로 모델을 선택하거나 무작위로 출력물을 청취할 수 있습니다.
“청취(Listen)” 탭은 기존 TTS 리더보드에서 중요한 간극을 메워줍니다: 다양한 모델의 출력을 탐색할 공간입니다.

생성된 출력물에 대한 피드백도 제공할 수 있습니다. 커뮤니티로부터 더 많은 투표를 수집함에 따라, 이 데이터를 리더보드에 포함할 수도 있습니다. 그러니 투표해 주세요! 하지만 스팸/봇을 걸러내는 데 도움을 주시려면 HF 계정으로 로그인해 주세요.

“Streaming” 탭에서는 스트리밍 기능을 비교합니다. 모델은 TTFA(time-to-first-audio)로 순위가 매겨지는데, 이는 사용자가 모델을 테스트한 후 오디오를 재생할 수 있을 때까지 기다리는 시간을 정량화한 것입니다. 이 지표는 음성 에이전트 및 기타 인터랙티브 앱에 중요합니다.
스트리밍 모델(✅ “Streaming API” 하단)의 경우, 첫 번째 오디오 청크가 도착하기까지 걸리는 시간입니다. 비스트리밍 모델의 경우, 재생을 그보다 일찍 시작할 수 없기 때문에 전체 발화가 생성될 때까지 걸리는 시간입니다. 모든 모델은 한 번에 하나의 오디오를 실행(배치 크기 1)하며, CV3-Eval의 동일한 50개 영어 프롬프트로, 동일한 하드웨어에서 기본 음성으로 테스트됩니다. 처음 3회 실행은 워밍업으로 제외하고 나머지 실행에 대한 중앙값 TTFA를 보고합니다.


기본 보기에서는 H200 GPU에서의 성능을 비교합니다. 소규모(하지만 증가하는) 모델 세트에 대해서는 CPU 결과도 이용 가능합니다!

kyutai/pocket-tts는 GPU와 CPU 모두에서 스트리밍에 매우 좋은 모델입니다!
Open TTS Leaderboard의 목표는 놀라운 속도로 출시되는 TTS 모델을 따라잡는 것뿐만 아니라, 커뮤니티가 주도하도록 하는 것입니다. 평가가 관련성 있고 통찰력이 있도록 여러분의 피드백을 듣고 싶습니다. 어떤 데이터셋, 모델, 지표를 보고 싶은지 알려주세요!
현재 저희는 다음 사항에 중점을 두었습니다:
오픈 소스 모델: 아레나 스타일의 평가에서 간과되었던 훌륭한 많은 모델들을 제시하기 위함입니다.다국어: 영어 성능이 다른 언어를 위한 적절한 대리 지표가 아니기 때문입니다.
곧 Open ASR Leaderboard 저장소와 유사하게 평가 스크립트를 오픈 소스로 공개할 예정이므로, GitHub Issues 및 PR을 통해 직접 피드백과 제안을 제공하실 수 있습니다! 함께 TTS 평가를 만들어 갑시다 🤗
AI 자동 생성 콘텐츠
본 콘텐츠는 Hugging Face Blog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기