Vaniq-Edge: 34MB 로컬 TTS 엔진 (~8.5M 파라미터, 2.94% WER)
요약
8.5M 파라미터 규모의 초경량 로컬 TTS 엔진인 Vaniq-Edge를 소개합니다. 34MB의 작은 크기로도 2.94%의 낮은 단어 오류율(WER)을 기록하며, 외부 보코더 없이 실시간에 가까운 빠른 추론 성능을 제공합니다.
핵심 포인트
- 8.5M 파라미터 및 34.3MB의 초경량 모델 설계
- Whisper WER 2.94% 및 UTMOS22 4.35/5.0의 높은 품질
- CPU 환경에서도 실시간보다 약 3.8배 빠른 추론 속도
- 외부 보코더가 필요 없는 엔드 투 엔드 독립형 구조
로컬 대화형 음성 에이전트(conversational voice agents)를 구축할 때는 보통 좌절스러운 트레이드오프(trade-off)가 따릅니다. 수 기가바이트(GB) 규모의 모델은 음질은 훌륭하지만 1~2초의 지연 시간(latency)이 추가되는 반면, 아주 작은 마이크로 모델(micro-models)은 단어 오류율(Word Error Rates, WER)이 매우 높아 단어를 건너뛰거나 자음을 웅얼거리는 등의 문제를 겪곤 합니다.
마이크로 규모의 풋프린트(footprint)에 얼마나 많은 품질을 담을 수 있는지 확인하기 위해, 저는 약 8.5M 파라미터(parameters)를 가진 엔드 투 엔드(end-to-end) 독립형 로컬 TTS 엔진인 Vaniq-Edge를 구축했습니다.
텍스트를 입력하면 24kHz 모노(mono) 오디오가 출력됩니다. 백그라운드에서 실행되는 외부 보코더(vocoders)나 2단계 모델이 필요 없습니다.
🛠️ 모델 개요 (Model Overview)
- 총 파라미터 (Total Parameters): ~8.5M
- 모델 크기 (Model Size): 34.3 MB (FP32)
- 오디오 출력 (Audio Output): 24 kHz 고충실도(high-fidelity) 모노
- 라이선스 (License): 오픈 웨이트 (Open weights)
📊 벤치마크 및 성능 (Benchmarks & Performance)
저의 주요 목표는 긴 문장에서도 출력이 명확하고 이해하기 쉽도록 단어 오류율(Word Error Rate)을 낮게 유지하는 것이었습니다:
- 단어 오류율 (Whisper WER):
2.94% - 예측 품질 (UTMOS22):
4.35 / 5.0 - GPU 지연 시간 (CUDA): 초기 생성 시
< 110ms(0.064xRTF) - CPU 속도 (1-Core):
0.262xRTF (실시간보다 약 3.8배 빠름)
⚠️ 알려진 제한 사항 (Known Limitations)
트레이드오프에 대해 솔직하게 말씀드리고자 합니다:
- 단일 음성 (Single Voice): 영어 전용이며, 하나의 고정된 음성만 제공합니다. 음성 복제(voice cloning)나 화자 전환(speaker switching)은 불가능합니다.
- 텍스트 정규화 (Text Normalization): 복잡한 숫자, 특이한 약어, 또는 문장 부호가 없는 긴 텍스트는 여전히 처리에 어려움을 겪을 수 있습니다.
- 고주파 아티팩트 (High-Frequency Artifacts): 날카로운
s또는z발음에서 미세한 고주파 클리핑(clipping)이 간혹 발생할 수 있습니다.
💻 빠른 시작 (Quick Start)
Python에서 로컬로 테스트할 수 있습니다:
pip install torch torchaudio phonemizer espeakng-loader==0.2.4 num2words scipy huggingface_hub Unidecode
import sys
import torch
...
🔗 데모 시도 / 링크 (Try the Demo / Links)
Hugging Face 모델 저장소: Abiray/Vaniq-Edge
Abiray/Vaniq-Edge · Hugging Face
우리는 오픈 소스(Open Source)와 오픈 사이언스(Open Science)를 통해 인공지능을 발전시키고 민주화하는 여정에 있습니다.
huggingface.co
대화형 플레이그라운드 (ZeroGPU): Vaniq-Edge 데모 스페이스
직접 테스트해 보신다면, 특이한 이름, 숫자, 또는 발음하기 어려운 문장(Tongue twisters)과 같이 어려운 텍스트를 입력해 보세요. 그리고 모델이 엣지 케이스(Edge cases)를 어떻게 처리하는지 댓글로 알려주세요!
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기