
여러 로컬 TTS 모델을 위한 간단한 데스크톱 GUI (Tkinter)
요약
Kokoro 및 Chatterbox 등 다양한 로컬 TTS 엔진을 지원하는 가벼운 데스크톱 GUI 도구입니다. 텍스트 청크 분할, 목소리 복제, Hugging Face 모델 다운로드 등 핵심 기능에 집중하여 설계되었습니다.
핵심 포인트
- 불필요한 기능 없이 가벼운 TTS 엔진 전환 환경 제공
- 텍text 청크 분할 기능을 통한 모델 안정성 확보
- Chatterbox를 활용한 참조 오디오 기반 목소리 복제 지원
- DeepSeek v4를 활용한 저비용 고효율 개발 사례
https://preview.redd.it/qoogv5m1skfh1.png?width=688&format=png&auto=webp&s=3f06fb28ceec3cd3ab95bcebd0c71374332aac9b 여러 로컬 TTS (Text-to-Speech) 엔진을 지원하는 간단한 데스크톱 GUI (Tkinter)를 제작했습니다 (현재 Kokoro 및 Chatterbox를 지원하며, 앞으로 며칠 내에 더 추가할 예정입니다). 왜 만들었냐고요? 주로 불필요한 기능(bloat) 없이 TTS 엔진 사이를 전환할 수 있는 가벼운 도구를 원했기 때문입니다. 현재 이 프로그램은 다음과 같은 기능을 지원합니다: 사용자 정의 일시 정지(pause)를 포함하여 입력 텍스트를 청크(chunk) 단위로 분할 (많은 소형 모델들이 몇 단락 이상이 지나면 빠르게 횡설수설하기 때문), Chatterbox 엔진을 통한 참조 오디오로부터의 목소리 복제(voice cloning), Hugging Face에서 모델 직접 다운로드, 내장된 소형 오디오 플레이어, 출력물을 wav 파일로 저장. 모든 코드는 많은 가이드(handholding)와 함께 DeepSeek v4에 의해 작성되었습니다. 제작 비용은 총 5달러 미만이 들었습니다. DeepSeek의 가격 정책은 정말 놀랍습니다. https://github.com/AmitTzah/TTS-Studio /u/NarrowEffect에 의해 제출됨 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기