NVIDIA Magpie TTS로 저지연 다국어 음성 에이전트 구축: 오픈 웨이트 및 완전한 배포 제어
요약
NVIDIA Magpie TTS는 오픈 웨이트 기반의 저지연 다국어 음성 에이전트 구축을 위한 솔루션입니다. 이 모델은 자체 인프라에 배포 가능하며, 여러 언어를 지원하고 워크로드별 지연 시간 최적화 및 사용자 정의가 가능합니다. 특히 한국어와 Modern Standard Arabic 등 신규 언어 커버리지를 확장했습니다.
핵심 포인트
- 오픈 웨이트 기반으로 완전한 배포 제어가 가능합니다.
- 저지연 다국어 음성 에이전트 구축에 최적화되었습니다.
- 자체 인프라에서 데이터 거주 및 프라이버시 요건 충족이 용이합니다.
- 한국어, Modern Standard Arabic 등 신규 언어를 지원하며 품질을 개선했습니다.
NVIDIA Magpie TTS로 저지연 다국어 음성 에이전트 구축: 오픈 웨이트 및 완전한 배포 제어
모든 음성 상호작용에는 지연 시간(latency) 예산이 있습니다.
사용자가 애플리케이션의 응답을 듣기까지, 이미 오디오를 캡처하고, 음성을 전사하며, LLM을 실행하고, 컨텍스트를 검색하고, 응답을 생성하는 데 귀중한 밀리초가 소요됩니다. Text-to-speech (TTS)는 마지막 단계이며 — 사용자가 가장 많이 알아차리는 부분입니다. 음성 생성이 느리면 전체 경험이 느리게 느껴집니다.
파이프라인의 더 많은 부분을 직접 실행하고 조정할 수 있을수록, 지연 시간 예산을 더 많이 확보하게 됩니다.
음성 AI는 빠르게 발전하고 있습니다. 통합된 음성 모델은 단순성을 제공합니다 — 하나의 API 호출로 오디오 입력과 오디오 출력을 처리하지만, 각 구성 요소를 도메인에 맞게 미세 조정하거나, 새로운 모델이 출시될 때 더 나은 모델로 교체하거나, 데이터 거주지(data residency)를 강제하고, 지연 시간이 정확히 어디서 발생하는지 이해하는 능력을 포기하게 만듭니다. 더 많은 제어를 위해서는 목적에 맞춰 설계된 ASR, TTS, LLM 구성 요소가 함께 실행되는 계층적 아키텍처(cascaded architecture)가 각 레이어를 독립적으로 조정하고 사용자가 소유한 인프라에 배포할 수 있게 합니다.
NVIDIA Magpie Multilingual TTS는 바로 그러한 환경을 위해 구축되었습니다. 오픈 웨이트, 프로덕션 준비가 된 NVIDIA NIM, 그리고 12개 언어 지원을 통해, 자체 인프라 내에서 다국어 음성을 배포하고, 워크로드에 맞춰 지연 시간을 최적화하며, 도메인에 맞게 모델을 사용자 정의할 수 있습니다 — 처음부터 끝까지, 자신만의 환경에서요.
최신 버전에서는 Modern Standard Arabic, 한국어, 브라질 포르투갈어를 추가하여 다국어 커버리지를 확장하는 동시에, 업데이트된 훈련 데이터와 모델 개선을 통해 기존의 많은 언어 전반에 걸쳐 품질을 향상시켰습니다.
고객 지원 에이전트, 의료 보조 도구, 엔터프라이즈 코파일럿, 번역 시스템 또는 대화형 AI 애플리케이션을 구축하든, Magpie는 프로덕션 음성 AI를 위한 오픈 기반을 제공합니다. 오늘날의 음성 애플리케이션은 단일 언어만을 다루지 않습니다.
글로벌 고객 지원, 엔터프라이즈 어시스턴트, 헬스케어 문서화, 리테일 자동화 및 번역 워크플로우는 낮은 지연 시간(low latency)을 유지하면서 여러 언어로 자연스러운 대화를 점점 더 많이 요구하고 있습니다.
더 많은 언어를 지원하는 것만이 도전 과제의 일부입니다. 개발자는 또한 다음 기능도 필요합니다:
- 데이터가 존재하는 곳에 배포할 수 있는 능력
- 엔터프라이즈 프라이버시 요건 충족
- 발음 및 목소리 사용자 정의
- 프로덕션 워크로드 하에서 지연 시간 예측
- 자체 인프라에서 확장(Scale)하는 것
오픈 모델은 이 모든 영역에서 가능한 것을 변화시키고 있습니다.
Magpie TTS Multilingual은 364M 파라미터의 오픈 웨이트 모델로, 다음을 지원합니다:
English · Spanish · French · German · Italian · Vietnamese · Mandarin · Hindi · Japanese · Modern Standard Arabic (신규) · Korean (신규) · Brazilian Portuguese (신규)
각 언어는 공유된 다국어 스피커 표현(shared multilingual speaker representation)을 통해 남성 및 여성 화자 목소리를 포함합니다.
이번 릴리스에서는 IPA grapheme-to-phoneme 처리와 사용자 정의 발음 사전(custom pronunciation dictionaries)을 통해 Hindi와 Japanese의 코드 스위칭(code-switching) 지원이 확장되어 다국어 유연성이 향상되었습니다. 이는 이름, 기술 용어 및 혼합 언어 콘텐츠를 더 정확하게 발음하는 것을 쉽게 만듭니다.
개발자는 여러 지역별로 별도의 TTS 모델을 유지할 필요 없이 단일 오픈 기반 위에서 다국어 애플리케이션을 구축할 수 있습니다.
대화형 AI(conversational AI)에서 텍스트 음성 변환(text-to-speech)은 사용자가 응답을 듣기 직전의 마지막 단계입니다. 따라서 첫 오디오까지 도달하는 지연 시간과 음성 생성 시작 사이의 지연 시간인 Time to First Audio (TTFA)는 음성 파이프라인에서 가장 중요한 지연 시간 측정 항목 중 하나입니다.
Magpie TTS가 자체 환경 내에 배포될 수 있기 때문에, 사용자가 측정하는 지연 시간은 관리형 서비스(managed-service)의 왕복 시간(round-trip)을 포함하지 않는, 실제로 제어하는 서버 측 지연 시간입니다.
| GPU | 1-stream TTFA | 1-stream RTFX | 64-stream TTFA | 64-stream RTFX |
|---|---|---|---|---|
| B200 | 32 ms | 12.1× | 239 ms | 319.81× |
| ... | ||||
| *출처: NVIDIA TTS NIM 성능 문서(v26.07), 세 번의 시도 평균, 온프레미스.*TTFA = 첫 오디오까지의 지연 시간; RTFX = 실시간 대비 처리량 배수. |
B200에서 32ms라는 Magpie의 TTFA는 ASR 및 LLM 처리를 위한 나머지 지연 시간 예산을 남겨두어, 전체 종단 간(end-to-end) 지연 시간을 자연스러운 대화에 필요한 200ms 미만 범위 내로 유지합니다. NVIDIA GPU 전반에서 Magpie는 단일 스트림으로 32–79ms 만에 첫 오디오를 제공합니다. 64개의 동시 스트림에서는 B200이 239ms의 TTFA를 달성하는 동시에, 실시간 대비 320배의 처리량을 제공하여, 동시 부하 조건에서도 재생되는 속도보다 300배 이상 빠르게 오디오를 생성합니다.
위 표는 Magpie가 온프레미스에서 서비스된 NVIDIA NIM으로 측정된 결과입니다. 즉, 사용자의 자체 GPU에서 실행되는 최적화된 컨테이너입니다. 공개된 Hugging Face 체크포인트는 동일한 모델이며 연구 및 미세 조정(fine-tuning)을 위한 경로이고; NIM은 이러한 프로덕션 지연 시간을 생성하는 튜닝된 서비스 스택입니다. 두 가지 모두 사용자가 제어하는 하드웨어에서 실행됩니다.
모델이 자체 인프라에서 실행되기 때문에, 성능을 직접 벤치마킹하고 배포에 맞게 조정하며 워크로드에 따라 확장할 수 있습니다. 실시간 음성 에이전트의 경우, 이것은 반응성이 느껴지는 대화와 지연되는 것처럼 느껴지는 대화 사이의 차이를 만듭니다.
낮은 지연 시간은 우연이 아닙니다. Magpie는 음성 품질을 유지하면서 추론 시간(inference time)을 줄이는 두 가지 상호 보완적인 아키텍처 개선 사항을 도입합니다.
프레임 스태킹(Frame stacking). 디코더가 각 디코딩 단계에서 하나가 아닌 두 개의 오디오 프레임을 예측합니다. 이는 디코더 반복 횟수를 절반으로 줄여 생성 시간을 단축하고 처리량을 향상시킵니다.
Local Transformer. 프레임 스태킹(Frame stacking)만으로는 동시에 생성되는 코드북 토큰 사이에 의존성을 도입하여 오디오 품질을 저하시킬 수 있습니다. 로컬 트랜스포머는 이러한 의존성을 모델링하고 생성된 오디오를 정제함으로써, 프레임 스태킹이 희생시켰을 오디오 품질을 회복합니다.
이러한 기술들을 결합하여 더 빠른 생성 속도와 자연스러운 음성 합성 모두를 제공합니다. 이 아키텍처는 'Frame-Stacked Local Transformers for Efficient Multi-Codebook Speech Generation (ICASSP 2026)'에 설명되어 있습니다.
이번 릴리스는 단순히 언어를 추가하는 것뿐만 아니라, 기존의 여러 언어 전반에 걸쳐 합성 품질을 향상시킵니다. 이전 릴리스와 비교했을 때, Magpie는 여러 언어에서 감소된 문자 오류율(CER)과 높은 화자 유사도(SSIM)를 보여주며, 특히 프랑스어와 스페인어에서 가장 두드러진 개선을 보였습니다:
| Language | CER (prev) | CER (this release) | SSIM (prev) | SSIM (this release) |
|---|---|---|---|---|
| French | 2.70% | 1.54% | 0.703 | 0.747 |
| ... | ||||
| 출처: Magpie TTS Multilingual model card. CER는 낮을수록 좋고, SSIM은 높을수록 좋습니다. |
새롭게 추가된 아랍어(1.62% CER), 한국어(2.69%), 브라질 포르투갈어(2.91%) 모델은 향후 개선을 위한 기준 품질을 확립합니다.
객관적인 지표가 진행 상황을 측정하는 데 도움을 주지만, 음성 품질은 궁극적으로 지각적입니다. NVIDIA Build 또는 Hugging Face 데모에서 직접 차이를 들으실 수 있습니다.
측정할 수 있는 레이턴시(Latency)도 유용합니다. 제어할 수 있는 레이턴시는 훨씬 더 좋습니다.
오픈 웨이트는 개발자에게 배포를 소유하는 것에서 오는 역량을 제공합니다. Magpie를 사용하면 다음을 할 수 있습니다:
제어하는 인프라에 배포하세요 — 사설 또는 에어 갭(air-gapped) 환경을 포함하여 전적으로 자체 인프라 내에서 실행합니다.지연 시간 예산을 소유하세요 — 관리형 서비스의 왕복 과정이 없으며, 하드웨어 및 워크로드에 맞춰 직접 최적화할 수 있습니다.발음과 목소리를 맞춤 설정하세요 — NeMo를 사용하여 자체 브랜드, 도메인 어휘 또는 화자 데이터로 미세 조정합니다.자신만의 조건으로 확장하세요 — 인프라와 워크로드에 맞춰 서빙 스택을 최적화합니다.엔터프라이즈 수준의 제어권을 유지하세요 — 민감한 대화 내용과 고객 데이터를 환경 내부에 보관할 수 있습니다.
프로덕션급 음성 AI를 구축하는 엔터프라이즈에게 있어, 배포, 성능 및 맞춤 설정에 대한 이러한 통제권이 가장 중요한 요소인 경우가 많습니다.
프로덕션 환경의 음성 AI는 단일 모델이 아닌 시스템입니다. Magpie TTS는 NVIDIA Nemotron Voice Agent Developer Example의 일부로, 목적에 맞춰 설계된 스피치(speech), 언어(language), 추론(reasoning) 모델들이 어떻게 협력적인 시스템으로 작동하는지 보여주는 레퍼런스 구현체입니다. 따라서 단순히 음성 품질만 개선하는 것을 넘어, 항상 작동하는 음성 에이전트를 구축할 수 있습니다.
개발자들은 다음을 결합할 수 있습니다:
- 스트리밍 스피치 인식용 Nemotron Speech
- 자연스러운 다국어 음성 합성을 위한 Magpie TTS
- 추론, 도구 호출 및 멀티모달 이해를 위한 Nemotron 언어 및 멀티모달 모델
- GPU 최적화된 프로덕션 레디(production-ready) 추론 마이크로서비스용 NVIDIA NIM
- 맞춤 설정 및 미세 조정을 위한 NeMo
Nemotron Voice Agent 개발자 예제는 개발자들이 몇 시간 만에 클론하고, 맞춤 설정하며, 배포할 수 있는 엔드투엔드 레퍼런스 구현체를 제공합니다. 여기에는 다음을 위한 프로덕션 패턴이 포함됩니다:
- 실시간 중단 가능(barge-in) 대화
- 비전 이해를 갖춘 멀티모달 음성 에이전트
- 다중 에이전트 오케스트레이션 및 도구 호출
- 다국어 음성 상호 작용
- NVIDIA NIM을 사용한 서브 세컨드(sub-second) 엔드투엔드 지연 시간
개발자들은 개별 구성 요소를 처음부터 조립하기보다는, 완전한 레퍼런스 아키텍처에서 시작하여 자체 애플리케이션에 맞게 조정할 수 있습니다.
모델 사용해 보기
프로덕션 배포(Deploy to production)
- NVIDIA Magpie Multilingual TTS NIM — 최적화된 추론 컨테이너
도메인 맞춤 설정(Customize for your domain)
- NVIDIA NeMo Speech — 파인튜닝 및 학습
완전한 음성 에이전트 구축(Build complete voice agents)
오픈 웨이트 및 라이선스(Open weights and license)
- Hugging Face의 모델 카드 — NVIDIA Open Model License 하 오픈 웨이트.
권장 추론 설정:
cfg_scale = 2.5 # classifier-free guidance — 텍스트 준수도를 높이려면 이 값을 올리세요
temperature = 0.6
top_k = 80
...
AI 자동 생성 콘텐츠
본 콘텐츠는 Hugging Face Blog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기