이제 자신의 목소리나 언어로 저의 3.96M 파라미터 TTS를 파인튜닝(Fine-tune)할 수 있습니다
요약
Inflect-Nano/Micro-v2 모델을 사용자의 목소리나 특정 언어로 파인튜닝할 수 있는 새로운 툴킷이 공개되었습니다. 단일 화자 데이터와 전사 데이터를 활용해 학습을 재개하고 PyTorch 또는 ONNX 형식으로 내보낼 수 있는 워크플로우를 제공합니다.
핵심 포인트
- 3.96M 및 9.35M 파라미터 규모의 경량 TTS 모델 지원
- 단일 화자 녹음 및 전사 데이터를 통한 지도 적응(Supervised adaptation) 가능
- PyTorch 및 ONNX 런타임 호환성 확보
- 새로운 음소 목록 처리를 통한 다국어 전이 학습 지원
지난주 Inflect v2를 출시했을 때, 대부분의 사람들이 이렇게 작은 TTS 모델이 실제로 괜찮은 소리를 내는지 물어볼 것이라고 생각했습니다. 하지만 대신 두 가지 질문을 계속 받았습니다: “내 목소리로 학습시킬 수 있나요?” “다른 언어로 옮길 수 있나요?” 당시 저의 답변은 기본적으로 다음과 같았습니다: 기술적으로는 가능하지만, 다른 사람이 사용할 수 있을 만큼 신뢰할 만한 공개 워크플로우(Workflow)는 없다는 것이었습니다. 그래서 저는 주말 동안 이를 구축하는 데 시간을 보냈습니다. 원래 출시 소식을 놓치셨을 분들을 위한 빠른 배경 설명입니다:
Inflect-Nano-v2: 3,966,721 파라미터, 15.97 MB FP32
Inflect-Micro-v2: 9,356,513 파라미터, 37.53 MB FP32
이것들은 24 kHz 웨이브폼 디코더(Waveform decoder)를 포함한 학습된 텍스트-to-웨이브폼(Text-to-waveform) 모델입니다. eSpeak-ng는 음소화(Phonemization)를 별도로 처리하며 파라미터 수에는 포함되지 않습니다. Micro 버전이 소리가 더 좋습니다. 아직 들어보지 못했다면 여기서 시작하세요: https://huggingface.co/owensong/Inflect-Micro-v2
새로운 툴킷(Toolkit)을 사용하면 여러분의 단일 화자 녹음 파일과 전사(Transcript) 데이터를 가져와 Nano 또는 Micro를 웜 스타트(Warm-start)하고, 학습을 재개하며, 검증용 출력(Held-out output)을 검사하고, 결과를 PyTorch 또는 ONNX로 내보낼 수 있습니다. 두 가지 까다로운 부분은 출시된 체크포인트(Checkpoint)에는 존재하지 않는 학습 전용 구성 요소를 재구축하는 것과, 영어와 공유되는 모든 임베딩(Embedding)을 초기화하지 않고 새로운 음소 목록(Phoneme inventories)을 처리하는 것이었습니다. 이제 툴킷이 이 두 가지를 모두 처리합니다. 저는 Nano를 사용하여 전체 소프트웨어 경로를 테스트했습니다: 실제 CUDA 학습 단계, 저장 및 재개, 엄격한 PyTorch 로딩, 그리고 ONNX Runtime과의 일치성을 확인했습니다.
툴킷: https://github.com/owenawsong/Inflect/tree/main/finetune
아직 출시 품질이라고 부를 만한 비영어 모델을 학습시켜 보지는 못했습니다. 파이프라인은 작동하지만, 이것이 이 정도로 작은 모델이 다른 언어로 깔끔하게 전이(Transfer)될 수 있는지를 알려주지는 않습니다. 또한 각 실행은 구성된 하나의 언어에 대해 하나의 고정된 목소리를 생성합니다. 이것은 지도 적응(Supervised adaptation)이지, 제로샷 클로닝(Zero-shot cloning)이 아닙니다. 저는 우선 하나의 언어를 제대로 조사할 수 있는 충분한 컴퓨팅 자원만 가지고 있어서 짧은 양식을 만들었습니다. 첫 번째 질문만 답변해 주시면 됩니다: https://tally.so/r/44RBvB
기존의 영어 가중치(Weights)는 변경되지 않았습니다.
만약 이전에 작은 TTS 모델을 적응(Adapt)시켜 본 적이 있다면, 언어를 변경했을 때 가장 먼저 실패했던 부분은 무엇인가요? 그것이 제가 첫 번째 본격적인 실행(Run)을 시작하기 전에 측정하고 싶은 부분입니다. /u/b111ue 제출 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기