srt2speech: 음성 복제 및 자동 길이 매칭을 지원하는 오픈 소스 다국어 SRT 내레이션 도구 - 오프라인 및 경량화
요약
srt2speech는 SRT 자막의 타이밍에 맞춰 음성을 생성하고 자동으로 길이를 매칭하는 오픈 소스 다국어 내레이션 도구입니다. 외부 API 없이 로컬 환경에서 음성 복제와 다중 화자 지원이 가능하며, 경량화된 설계를 통해 다양한 하드웨어에서 구동됩니다.
핵심 포인트
- SRT 자막의 일시 정지 및 시간 슬롯에 맞춘 정확한 음성 배치
- {{speaker_name}} 템플릿을 통한 간편한 다중 화자 전환 지원
- Python, NumPy, llama.cpp 기반의 경량화 및 오프라인 작동
- 영어, 한국어, 일본어 등 다양한 다국어 지원
- Q4 양자화 모델 사용으로 저사양 하드웨어에서도 원활한 성능
작은 사이드 프로젝트를 위해, 값비싼 하드웨어나 외부 API에 의존하지 않고 영상을 내레이션할 수 있는 기본적인 AI 음성 도구가 필요했습니다. 가장 표현력이 풍부한 AI일 필요는 없었으며, 단지 신뢰할 수 있는 출력과 SRT와의 매칭만 되면 되었습니다. SRT 자막을 음성으로 변환할 때의 주요 과제는 타이밍입니다. 자막에는 일시 정지(pause)가 포함되어 있으며, 각 발화 문장은 정확한 시간 슬롯에 맞춰져야 합니다. 대부분의 음성 생성기(speech generators)는 이를 자체적으로 잘 처리하지 못합니다. 그래서 저는 srt2speech를 만들었습니다. 이 도구는 다음의 조합을 사용합니다:
- 피치(pitch)가 보정된 속도 조절
- 단어 사이의 일시 정지 자동 재생성 수정
- 자막 큐(cue) 사이의 무음(silence)의 정확한 배치
SRT는 다중 화자를 지원하지 않기 때문에, 간단한 템플릿 기능도 추가했습니다. 자막에 {{speaker_name}}를 추가하면 자동으로 목소리가 전환됩니다. 물론 음성 복제(voice cloning)도 지원하며, 작은 헬퍼 스크립트를 추가했습니다. 의존성(Dependencies)은 최소한입니다: Python, NumPy, llama.cpp, 그리고 필요한 GGUF 음성 모델들입니다. 저는 Q4 양자화(quantization)로 테스트했으며 잘 작동합니다.
제 노트북에서의 성능:
- RTX 4080 Laptop GPU: 약 12–13배 실시간(real time)
- CPU 전용: 약 1.5–2.0배 실시간(real time)
지원 언어:
- 영어 (en)
- 일본어 (jp)
- 한국어 (ko)
- 중국어 (zh)
- 프랑스어 (fr)
- 독일어 (de)
이 도구는 오래된 PC, Linux 또는 Mac을 포함한 거의 모든 하드웨어에서 작동할 것입니다. 내레이션 생성, 번역된 오디오 트랙, 접근성 오디오 또는 빠른 비디오 보이스오버를 만드는 모든 분에게 유용할 수 있습니다. 이 프로젝트는 Apache 2.0 라이선스 하에 오픈 소스로 제공됩니다. 출처 표기 및 라이선스 고지는 반드시 유지되어야 합니다.
GitHub: https://github.com/Waversense/srt2speech/
README 파일에는 설정을 위해 필요한 5단계가 포함되어 있으며, 2분 안에 시작할 수 있습니다. 포함된 demo.srt 파일이 기능을 시연합니다. Whisper 통합을 포함하여 다양한 AI에 대한 더 많은 지원이 업데이트될 예정입니다. 이 도구는 항상 경량화된 상태와 간단한 설치 방식을 유지할 것입니다.
제출자: /u/Charming-Author4877 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기