
Inflect v2 출시: 4M 및 10M 파라미터 미만의 초소형 완전 TTS 모델 2종
요약
4M 및 10M 미만의 파라미터를 가진 초소형 완전 TTS 모델인 Inflect v2가 출시되었습니다. 외부 보코더 없이 CPU/CUDA 환경에서 로컬로 실행 가능하며, 크기 대비 뛰어난 음성 품질과 실시간 추론 성능을 제공합니다.
핵심 포인트
- Inflect-Nano-v2(3.96M)와 Micro-v2(9.36M) 두 가지 모델 제공
- 외부 보코더나 API 없이 단일 모델로 텍udio 생성 가능
- CPU 환경에서 매우 빠른 실시간 추론 성능 확보
- 영어 전용이며 고정된 남성 음성 사용 및 음성 복제 미지원
저는 지난 한 달 동안 극도로 작은 TTS (Text-to-Speech) 모델이 단순한 크기 실험을 넘어 진정으로 유용하게 느껴지는 지점이 어디인지 찾기 위해 노력해 왔습니다. 오늘 저는 두 가지 완전한 로컬 TTS 모델을 포함한 Inflect v2를 출시합니다: Inflect-Nano-v2: 3.96M 파라미터, 15.97 MB FP32, Inflect-Micro-v2: 9.36M 파라미터, 37.53 MB FP32. 이것들은 음향 모델(acoustic-model)만의 수치가 아닌, 전체 추론(inference) 파라미터 수입니다. 텍스트 처리, 타이밍 예측, 음성 생성, 그리고 웨이브폼 디코더(waveform decoder)가 모두 포함되어 있습니다. 텍스트가 입력되면 24 kHz 음성이 출력됩니다. 외부 보코더(vocoder), 호스팅된 API, 또는 두 번째 학습된 모델이 필요하지 않습니다. Nano는 가능한 가장 작은 점유 공간(footprint)을 우선시합니다. Micro는 추가적인 용량을 사용하여 더 나은 명료도, 안정성 및 전반적인 음성 품질을 제공합니다. 두 모델 모두 동일한 PyTorch API를 통해 CPU 또는 CUDA에서 로컬로 실행됩니다. Inflect-Nano-v2는 제가 아는 한 여전히 진정으로 사용 가능한 음성을 생성하는 가장 작은 완전 신경망 TTS 모델 중 하나입니다. 심지어 9.36M 규모의 Micro 모델조차
결과적으로 도출된 모델들은 놀라울 정도로 우수한 성능을 보였습니다: Micro: 4.395 UTMOS22, 3.99% semantic WER (의미론적 단어 오류율), 6.28배 실시간 CPU 추론 (real-time CPU inference); Nano: 4.386 UTMOS22, 4.21% semantic WER, 10.72배 실시간 CPU 추론. 다른 소형 TTS 시스템들과의 블라인드 커뮤니티 비교에서 Micro와 Nano는 테스트된 음성들 중 2위와 3위를 차지했습니다. 전체 프로토콜, 원시 결과, 오디오 샘플 및 한계점은 모델 페이지에 문서화되어 있습니다. 모델이 완벽하지는 않습니다. 이 모델들은 영어 전용이며, 하나의 고정된 남성 음성을 사용하고, 음성 복제 (voice cloning)를 지원하지 않습니다. 생소한 이름, 약어, 숫자 및 동형이의어 (homographs)는 여전히 가장 어려운 입력값으로 남아 있습니다. Nano는 Micro보다 소리가 얇게 들릴 수 있으며, 두 모델 모두 가끔 금속성 소리나 끊기는 듯한 아티팩트 (artifacts)를 생성할 수 있습니다. 그럼에도 불구하고, 이는 크기 대비 품질의 트레이드오프 (tradeoff)가 진정으로 매력적으로 변했다고 생각하는 첫 번째 버전입니다. 저는 제한된 학습 예산을 가진 고등학생 개발자로서 독립적으로 Inflect를 구축했습니다. 그러한 제약이 프로젝트의 형태를 결정했습니다. 효율성은 추론 (inference)뿐만 아니라 학습 (training), 평가 (evaluation), 그리고 제가 이해하고 엔드 투 엔드 (end-to-end)로 출시할 수 있는 완전한 시스템을 구축하는 데에도 적용되어야 했습니다. 직접 체험해 보세요: 가장 빠르게 판단하는 방법은 인터랙티브 플레이그라운드 (interactive playground)를 통하는 것입니다: https://huggingface.co/spaces/owensong/Inflect-v2 Inflect-Micro-v2: https://huggingface.co/owensong/Inflect-Micro-v2 Inflect-Nano-v2: https://huggingface.co/owensong/Inflect-Nano-v2 코드 및 문서: https://github.com/owenawsong/Inflect 관심이 충분하다면, 모델을 더 축소하는 것보다 모델이 할 수 있는 일을 확장하는 데 집중한 v3를 구축할 수도 있습니다: 추가 음성, 아마도 더 많은 언어, 더 쉬운 미세 조정 (fine-tuning), 그리고 품질과 견고함 (robustness)에 대한 또 다른 개선 작업 등이 포함될 것입니다. 모델을 테스트하신다면, 정말로 어려운 것들을 입력해 주세요: 특이한 이름, 숫자, 약어, 어색한 문장 부호 또는 긴 문장 등입니다. 만약 무언가 제대로 작동하지 않는다면, 정확한 텍스트, 모델, 시드 (seed), 그리고 무엇이 이상하게 들렸는지를 게시해 주세요. 만약 잘 작동한다면, 어떤 하드웨어에서 실행했는지도 알려주시면 감사하겠습니다.
구체적이고 솔직한 피드백이 저에게 가장 도움이 됩니다. /u/b111ue 제출 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기