voice-pro
요약
Voice-Pro는 음성 인식, 번역, 다국어 더빙 기능을 통합한 오픈 소스 멀티미디어 제작 도구입니다. Whisper, F5-TTS, CosyVoice 등 최신 AI 모델을 활용하여 고성능 음성 솔루션을 제공합니다.
핵심 포인트
- Whisper 및 F5-TTS 기반의 고성능 음성 인식 및 복제 기능 제공
- uv 마이그레이션을 통한 빠르고 재현 가능한 설치 환경 구축
- Python 3.12 및 RTX 50 시리즈를 지원하는 최신 런타임 적용
- 모든 코드가 오픈 소스로 공개되어 자유로운 수정 및 배포 가능
최고의 AI 음성 인식, 번역 및 다국어 더빙 솔루션 🚀
한국어
∙
English
∙
中文简体
∙
中文繁體
∙
日本語
∙
Deutsch
∙
Español
∙
Português
Voice-Pro는 멀티미디어 콘텐츠 제작 방식을 변화시키는 최첨단 웹 앱입니다. 이 도구는 YouTube 비디오 다운로드, 음성 분리, 음성 인식 (Speech Recognition), 번역, 그리고 텍스트 음성 변환 (TTS) 기능을 통합하여 크리에이터, 연구자 및 다국어 전문가를 위한 강력한 단일 도구를 제공합니다.
- 🔊 최상급 음성 인식 (Speech Recognition):
Whisper, Faster-Whisper, Whisper-Timestamped - 🎤 제로샷 음성 복제 (Zero-shot Voice Cloning):
F5-TTS, E2-TTS, CosyVoice (Korean 및 8개 이상의 언어를 포함하는 Fun-CosyVoice3 포함) - 📢 다국어 텍스트 음성 변환 (Multilingual Text-to-Speech):
Edge-TTS, kokoro (본인의 키를 사용한 선택적 Azure TTS — Azure 서비스 참조) - 🎥 YouTube 처리 및 오디오 추출:
yt-dlp - 🌍 100개 이상의 언어에 대한 즉각적인 번역:
Deep-Translator (본인의 키를 사용한 선택적 Azure Translator)
ElevenLabs의 강력한 대안인 Voice-Pro는 팟캐스터, 개발자 및 크리에이터에게 고급 음성 솔루션을 제공합니다.
- WeConnect 개발 작업으로 인해, 당분간 Voice-Pro의 개발 및 업데이트는 불가능합니다.
- 저희는 모든 Voice-Pro 코드를 오픈 소스로 공개하였으며 완전히 무료로 제공합니다. 이제 누구나 Voice-Pro를 자유롭게 배포하고 수정할 수 있습니다.
- NVIDIA GPU가 장착된 Windows에서 잘 작동합니다. Mac 및 Linux에서의 작동은 검증되지 않았습니다.
- 요청 사항은 [GitHub Issues] 또는 [Discussions] 페이지에 남겨주세요.
문제 해결 (Troubleshooting): 대부분의 경우, installer_files 폴더를 삭제한 후 start.bat를 다시 실행하면 문제를 해결할 수 있습니다 (클린 재설치는 몇 분밖에 걸리지 않으며, model/에 다운로드된 AI 모델은 유지됩니다). 오류는 WebUI에서 닫을 때까지 유지되는 빨간색 토스트(red toasts) 메시지로 표시됩니다.
version 4.0
- ⚡ 설치 프로그램을 Miniconda/pip에서 uv로 마이그레이션 — 커밋된
uv.lock을 통해 훨씬 더 빠르고 완전히 재현 가능한 설치가 가능합니다. 모든 것은installer_files/내부에 유지됩니다.
(uv, Python, packages). - 🐍 업그레이드된 런타임 (runtime):
Python 3.12, Torch 2.8.0+cu128 (RTX 50-series 지원), Gradio 6.20. - 🎙️ 최신 ASR 스택:
faster-whisper 1.2.1(large-v3-turbo, distil-large-v3.5), openai-whisper 20250625, whisper-timestamped 1.15.9. whisperX는 제거되었습니다 (해당 라이브러리의 의존성 고정(dependency pins)이 Gradio 6 업그레이드를 차단함; 기존 설정은 faster-whisper로 대체됩니다). - 🗣️ 최신 TTS 스택:
F5-TTS 1.1.21, kokoro 0.9.4, edge-tts 7.x, 그리고 재배포된(re-vendored) CosyVoice(업스트림 메인). - 🇰🇷 새로운 선택형 TTS 모델:
Fun-CosyVoice3-0.5B— 한국어를 포함한 9개 언어를 지원하며, CosyVoice 탭에서 선택할 수 있습니다 (첫 사용 시 공식 HF 리포지토리에서 다운로드됩니다). - 🧹 CUDA Toolkit 및 Visual Studio Build Tools가
더 이상 필요하지 않습니다— 모든 의존성은 사전 빌드된 휠(prebuilt wheels) 형태로 제공되며, PyTorch에 CUDA 런타임이 포함되어 있습니다. - 🛡️ 제한된 / 기업용 PC에 친화적입니다: 관리자 권한이 필요하지 않습니다 — start.bat이
설치되어 있지 않은 경우 포터블 ffmpeg를 자동으로 다운로드하며, Whisper 모델 다운로드는 전송이 중단되거나 손상된 후에도 자체 복구(self-heal)가 가능합니다. 또한, 네트워크가 무료 Google 엔드포인트의 속도를 제한할 경우 번역이 지수 백오프(backoff)와 함께 자동으로 재시도됩니다 (실패한 줄은 보고되며, 원본은 유지됩니다). - 🚨
이제 WebUI에서 에러를 확인할 수 있습니다: 모든 실패는 사용자가 닫을 때까지 화면에 남아 있는 빨간색 에러 토스트(error toast)로 표시됩니다 (이전에는 놓치기 쉬운 10초간의 경고였습니다). 또한 일반적인 원인(ffmpeg 누락, 등록된 미디어 없음 등)에 대해 조치 가능한 메시지를 제공합니다. - 🖥️ UI: Gradio 6로 마이그레이션되었습니다 (모든 탭에 전체 너비 레이아웃 적용, 비디오 플레이어에 자막 트랙 직접 표시). - 🧽
uninstall.bat은
더 이상 관리자 권한을 요구하지 않으며 강제 재부팅을 수행하지 않습니다; uninstall.bat silent를 실행하면
사용자 개입 없이 실행됩니다.
version 3.2
- 지난 몇 달 동안 WeConnect 개발에 집중하느라 Voice-Pro를 전혀 관리하지 못했습니다.
- Voice-Pro의 모든 코드를 오픈 소스 (Open Source)로 공개하기로 결정했습니다.
- Voice-Pro는 완전히 무료이며 Windows, Mac, Linux를 지원합니다.
- WeConnect는 글로벌 문화 교류를 위한 애플리케이션 (Application)입니다.
- 의미 있는 문화 교류, 언어 학습, 그리고 국제적인 우정을 위해 전 세계 사람들과 연결되세요.
version 3.1
- 🪄 F5-TTS 미세 조정 모델 (Fine-tuned models) 지원
- 🌍 지원 언어
영어 및
중국어: SWivid/F5-TTS_v1
핀란드어: AsmoKoskinen/F5-TTS_Finnish_Model
프랑스어: RASPIAUDIO/F5-French-MixedSpeakers-reduced
힌디어: SPRINGLab/F5-Hindi-24KHz
이탈리아어: alien79/F5-TTS-italian
일본어: Jmica/F5TTS/JA_21999120
러시아어: hotstone228/F5-TTS-Russian
스페인어: jpgallegoar/F5-Spanish
version 3.0
- 🔥 AI Cover 기능 제거
- 🚀 m-bain/whisperX 지원 추가
version 2.0
-
🐍 Python 3.10.15, Torch 2.5.1+cu124, 그리고 Gradio 5.14.0으로 구축되었습니다.
-
🆓 무료 체험판은 최대 60초 길이의 미디어까지 지원합니다.
-
🔥 AI Cover 기능을 추가했습니다.
-
🎤 CosyVoice 및 kokoro 지원을 도입했습니다.
-
⏳ 최초 실행 시 **CozyVoice2-0.5B (9GB)**를 다운로드하며, 네트워크 속도에 따라 1시간 이상 걸릴 수 있습니다.
-
🎧 클로닝 (Cloning)을 위한 음성 샘플이 지속적으로 업데이트될 예정입니다.
-
📝 자연스러운 문장 단위 번역 및 TTS (Text-to-Speech)를 위해 spaCy를 추가했습니다.
-
☁️ 구독 버전에는 Microsoft Azure Translator 및 TTS가 포함됩니다.
-
🏪 구독 시 구독 기간 동안 무제한 사용 (60초 제한 없음)이 가능하며, 다음을 통해 이용할 수 있습니다.
-
YouTube 영상 다운로드 및 오디오 추출
-
Demucs를 이용한 음성 분리 (Voice separation)
-
음성 인식 및 번역을 위해 100개 이상의 언어 지원
STT (Speech-to-Text): Whisper, Faster-Whisper, Whisper-Timestamped
TTS (Text-to-Speech):
Edge-TTS: 100개 이상의 언어, 400개 이상의 음성
E2-TTS, F5-TTS, CosyVoice: 제로샷 클로닝 (Zero-shot cloning)
kokoro: HuggingFace TTS Arena에서 2위 기록
-
즉각적인 음성 인식 (Instant speech recognition)
-
실시간 다국어 번역 (Multilingual translation on the fly)
-
사용자 정의 가능한 오디오 입력 (Customizable audio inputs)
-
올인원 허브 (All-in-one hub): YouTube 다운로드, 노이즈 제거 (noise removal), 자막, 번역 및 TTS
-
모든 ffmpeg 호환 형식 지원
-
출력 옵션: WAV, FLAC, MP3
-
100개 이상의 언어에 대한 자막 및 인식 지원
-
속도, 볼륨 및 피치 (pitch) 조절이 가능한 TTS
-
자막 중심: 90개 이상의 언어 지원
-
비디오 통합 자막 표시
-
단어 단위 하이라이팅 및 노이즈 제거 (denoise) 옵션
-
100개 이상의 언어 번역 지원
-
자막 파일 지원 (ASS, SSA, SRT 등)
-
실시간 음성 인식 및 번역
-
옵션:
Edge-TTS, F5-TTS, CosyVoice, kokoro - 유명인 목소리 팟캐스트 및 다국어 지원 -
추가하고 싶은 목소리가 있다면 Issues 페이지에 요청해 주세요. [Issues]
영어
중국어
디리러바 (Dílì Rèbā) |
차이이린 (Cài Yīlín) |
우이판 (Wú Yìfán) |
리이펑 (Lǐ Yìfēng) |
양미 (Yáng Mì) |
자오리잉 (Zhào Lìyǐng) |
OS: Windows 10/11 (64-bit), Linux, Mac (Apple Silicon)
GPU: 최신 드라이버가 설치된 NVIDIA GPU (570 이상 권장; RTX 50 시리즈 지원). CUDA Toolkit 설치는 필요하지 않습니다.
VRAM: 4GB 이상 (8GB 이상 권장)
RAM: 4GB 이상
저장 공간: 20GB 이상의 여유 공간
인터넷: 필요
configure.bat 및 start.bat를 사용하여 Voice-Pro를 간편하게 설치하세요 (Mac/Linux에서는 configure.sh 및 start.sh 사용).
git clone https://github.com/abus-aikorea/voice-pro.git
-
🚀
configure.bat (선택 사항) -
git 및 ffmpeg를 시스템 전체에 설정합니다 (CUDA Toolkit / Visual Studio는 더 이상 필요하지 않음)
-
관리자 권한이 필요하며, 한 번만 실행하면 됩니다.
-
관리자 권한이 없나요? 건너뛰셔도 됩니다. start.bat가 portable ffmpeg를 자동으로 다운로드합니다.
-
🚀
start.bat -
Voice-Pro WebUI를 실행합니다.
-
첫 실행 시 uv + Python 3.12를 다운로드하고 lockfile로부터 모든 종속성(dependencies)을 설치합니다 (몇 시간이 아닌 몇 분 소요). 그 후 AI 모델을 다운로드합니다 (~10GB — 이 단계가 가장 오래 걸립니다).
-
GPU/CPU가 자동으로 감지됩니다.
GPU_CHOICE환경 변수(G= NVIDIA,C= CPU)를 사용하거나installer_files\gpu_choice.txt파일을 삭제하여 설정을 변경할 수 있습니다. -
문제가 발생할 경우 installer_files를 삭제한 후 재시도하세요.
-
🚀
update.bat: Python 환경을 커밋된 lockfile과 정확히 일치하도록 재동기화합니다 (빠름) -
uninstall.bat를 실행하거나 폴더를 삭제하세요 (포터블 설치) - 관리자 권한이 필요하지 않습니다; 무인 제거(unattended removal)를 위해
silent를 추가하세요 (uninstall.bat silent). -installer_files폴더만 삭제되며,model/및workspace/폴더는 유지됩니다.
기본적으로 Voice-Pro는 무료 서비스를 사용합니다: 번역에는 Deep-Translator (Google의 무료 웹 엔드포인트)를, 음성 합성(Speech Synthesis)에는 Edge-TTS를 사용합니다. 본인 소유의 Microsoft Azure 구독이 있다면, 두 서비스 모두 Azure API로 전환할 수 있습니다:
-
프로젝트 루트의
.env.example을.env로 복사하세요:
copy .env.example .env# Windows
cp .env.example .env# Mac/Linux -
Azure 자격 증명(credentials)을 입력하세요:
# Azure Speech Service (TTS)
AZURE_SPEECH_KEY=your_azure_speech_key_here
AZURE_SPEECH_REGION=eastus
# Azure Translator Service
AZURE_TRANSLATOR_KEY=your_azure_translator_key_here
AZURE_TRANSLATOR_ENDPOINT=https://your-translator-resource.cognitiveservices.azure.com/
AZURE_TRANSLATOR_REGION=eastus
- Voice-Pro를 재시작하세요. 유효한 키는 시작 시 자동으로 감지되며, 번역은 Azure Translator로 전환되고 첫 번째 음성 생성(Speech Generation) 탭은 Azure-TTS로 변경됩니다.
언제 이 설정을 할 가치가 있을까요?
- 🏢 기업 / 제한된 네트워크: 보안 장비가 무료
translate.google.com엔드포인트의 속도를 제한(rate-limit)하거나 차단하는 경우가 많으며, 이는 긴 자막 번역을 느리게 하거나 실패하게 만듭니다. Voice-Pro는 지수 백오프(backoff)를 사용하여 재시도하며, 실패한 줄에 대해서는 원문을 유지합니다 (실패 횟수와 함께 경고가 표시됩니다). 하지만 Azure Translator를 사용하면 이 문제를 완전히 피할 수 있습니다. - 🗣️ 더 높은 품질/일관된 TTS 음성 및 더 높은 속도 제한(rate limits).
절대로 .env 파일을 버전 관리 시스템(version control)에 커밋하지 마세요 — 여기에는 개인 키가 포함되어 있습니다.
-
Windows-Command 창을 닫고
start.bat을 다시 실행하세요. -
브라우저를 직접 실행하고 Windows-Command 창에 표시된 주소(예: **http://127.0.0.1:7870**)를 주소창에 입력하세요.
-
Windows 작업 관리자(Task Manager)의 성능(Performance) 탭에서 GPU 메모리 상태를 확인하세요.
-
Denoise(노이즈 제거) 레벨을 0 또는 1로 설정하세요. Denoise 레벨 2는 최소 8GB의 GPU 메모리가 필요합니다.
-
Compute Type(연산 유형)을 int 유형으로 설정하세요. float 유형은 품질이 더 좋지만 더 많은 GPU 메모리를 요구합니다.
-
자막의 품질은 더 큰 Whisper 모델을 사용할수록 향상되는 경향이 있으나, 반드시 그런 것은 아닙니다: large > medium > small > base > tiny
-
연산 유형 중 float 유형은 성능이 좋습니다. int 유형은 모델 양자화 (model quantization)를 통해 GPU 사용량을 줄이고 속도를 높인 모델입니다. 반면, 성능은 저하됩니다.
-
Denoise 레벨을 높이면 더 많은 배경음이 제거되고 남은 음성만 음성 인식 (voice recognition)에 사용됩니다. 이것이 항상 좋은 결과를 보장하는 것은 아닙니다.
-
WeConnect 개발 작업으로 인해 당분간 Voice-Pro 업데이트는 없을 예정입니다.
-
모든 Voice-Pro 코드는 오픈 소스 (open source)로 공개되었습니다. 이제 완전히 무료로 사용할 수 있습니다.
-
WeConnect는 글로벌 문화 교류를 위한 커뮤니케이션 플랫폼입니다.
다음 표는 자막 생성, 번역, 그리고 텍스트 음성 변환 (TTS/dubbing) 기능을 지원하는 SaaS 플랫폼 목록입니다. 비용은 2025년 4월 15일 기준 최신 가격 데이터를 바탕으로, 자막 생성, 영어 번역, 영어 더빙을 포함하여 60분 분량의 한국어 영상을 처리할 때를 기준으로 계산되었습니다.
| 플랫폼 (Platform) | 자막 생성 (Subtitling) | 번역 (Translation) | TTS/더빙 (TTS/Dubbing) | 60분 영상 기준 비용 (USD, 약) | 주요 특징 (Key Features) |
|---|---|---|---|---|---|
| Maestra | ✅ | ✅ | ✅ | $23.70 | 125개 이상의 언어, 실시간 자막, SEO 키워드 추출, 15분 무료 체험. |
| Kapwing | ✅ | ✅ | ✅ | $30~$40 (Pro 플랜, 분당) | AI 자막, 100개 이상의 언어 번역, 자동 립싱크 (lip-sync) 더빙, 무료 티어 제공. |
| VEED.IO | ✅ | ✅ | ❌ | $24~$36 (Pro 플랜, 일부) | 99.9% 정확도의 자막, 인스타그램 최적화 자막, 직관적인 편집기. |
| HappyScribe | ✅ | ✅ | ✅ | $36~$48 (종량제, Pay-as-you-go) | 120개 이상의 언어, 전문적인 교정 (proofreading), 보안 강화, 회의 녹취 (meeting transcription). |
| Sonix | ✅ | ✅ | ✅ | $30~$40 (Standard 플랜) | 54개 이상의 언어, 30분 무료 녹취, YouTube/Zoom 연동. |
| Descript | ✅ | ✅ | ✅ | $36~$48 (Creator 플랜) | 텍스트 기반 편집, Overdub TTS, 추임새 (filler word) 제거, 1시간 무료 녹취. |
| AppTek | ✅ | ✅ | ✅ | 맞춤형 가격 (문의 필요) | 미디어 중심, 맞춤형 모델, 메타데이터 생성, 클라우드 기반 Workbench. |
| Transkriptor | ✅ | ✅ | ❌ | $12~$18 (종량제, Pay-as-you-go) | 100개 이상의 언어, YouTube 링크 녹취, 99% 정확도, 간편한 편집기. |
AI 자동 생성 콘텐츠
본 콘텐츠는 GitHub Trending All (daily)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기