
7가지 조절 가능한 감정을 가진 오픈 소스 온디바이스 TTS 모델, NeuTTS-2E를 개발했습니다
요약
7가지 조절 가능한 감정을 지원하는 125M 파라미터 규모의 오픈 소스 온디바이스 TTS 모델 NeuTTS-2E를 공개했습니다. 사용자의 명시적 지시에 따라 감정을 표현하며, 로컬 실행을 통해 프라이버시를 보호하고 효율적인 음성 생성이 가능합니다.
핵심 포인트
- 7가지 감정(화남, 두려움, 행복 등)을 사용자가 직접 선택 가능
- 1억 2,500만 개의 활성 파라미터를 가진 경량 온디바이스 모델
- 화자 유지 및 로컬 실행을 통한 프라이버시 보호 기능 제공
- 제한된 데이터와 레이블 문제를 해결한 오픈 소스 모델
저희는 1억 2,500만(125M) 개의 활성 파라미터(active parameters)와 7가지 조절 가능한 감정을 갖춘 온디바이스(on-device) TTS 모델인 NeuTTS-2E의 알파 버전을 오픈 소스로 공개합니다. 목표는 간단했습니다. 사용자가 “화남(angry)”, “두려움(fearful)”, 또는 “행복함(happy)”을 선택했을 때, 모델이 텍스트에서 추론하는 감정이 아니라 해당 지시를 따르는 것입니다. NeuTTS-2E를 통해 다음과 같은 작업이 가능합니다:
- 연기 지시: 각 생성 시 의도한 감정을 선택할 수 있습니다.
- 화자 유지: 선택한 목소리를 유지하면서 다양한 감정 표현을 탐색할 수 있습니다.
- 로컬 실행: 본인의 하드웨어에서 표현력이 풍부한 영어 음성을 생성할 수 있습니다.
- 프라이버시 보호: 텍스트와 오디오가 기기를 벗어날 필요가 없습니다.
- 효율적인 구축: 1억 2,500만 개의 활성 파라미터를 가진 저희의 가장 작은 모델을 사용하여 감정 음성 생성을 실행할 수 있습니다.
- 개방형 구축: NeuTTS 오픈 라이선스(NeuTTS Open License)에 따라 오픈 소스 모델에 접근할 수 있습니다.
이 과정에서 제한된 감정 음성 데이터, 신뢰할 수 없는 레이블(labels), 그리고 발화된 감정과 텍스트 의미론(semantics)을 분리하는 문제들을 해결해야 했습니다. NeuTTS-2E는 로컬에서 실행되며 4가지 내장 음성을 지원합니다. 커뮤니티의 피드백을 받기 위해 조기에 공유하며, 여러분이 무엇을 만들어낼지 정말 기대됩니다!
GitHub: https://github.com/neuphonic/neutts
Hugging Face 모델 컬렉션: https://huggingface.co/collections/neuphonic/neutts-2e
대화형 데모: https://huggingface.co/spaces/neuphonic/neutts-2e
웹사이트: https://www.neuphonic.com/models/neutts-2e
submitted by /u/TeamNeuphonic [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기