Sopro V2 Turbo 2610: 더 깨끗해진 클론 음성, 동일한 120M 모델, CPU에서 실시간보다 5배 빠름
요약
Sopro V2 Turbo 2610은 클론 음성에서 발생하던 거칠거나 끊기는 현상을 개선하는 데 초점을 맞춘 업데이트입니다. 동일한 120M 모델을 유지하면서도 CPU 환경에서 실시간보다 훨씬 빠르게 작동하며, Apache-2.0 라이선스로 영어, 유럽 포르투갈어 등 다양한 언어를 지원합니다.
핵심 포인트
- 클론 음성 품질 개선: 거칠거나 끊기는 현상 감소
- 효율적인 성능: 동일 모델 크기 대비 CPU에서 빠른 속도 구현
- 다국어 및 기능 확장: 여러 언어 지원 및 생성된 음성에 대한 제어 계획
- 로컬 실행 용이: uvx 명령어로 쉽게 로컬 환경에 배포 가능
우선, 제 최신 게시물에 대한 반응과 피드백에 감사드립니다. 이것은 그 게시물의 후속 내용입니다. 사람들이 겪었던 주요 문제 중 하나는 일부 클론 음성에서 거칠거나 끊기는 현상이었습니다. 2610은 주로 이 문제를 개선하는 데 초점을 맞춘 임시 업데이트입니다. 이전에는 어려움을 겪었던 일부 음성에서 거칠고 끊기는 현상을 줄였습니다. 동일한 120M 모델, 동일한 속도(~노트북 CPU에서 첫 오디오까지 약 300ms) Apache-2.0 영어, 유럽 포르투갈어, 프랑스어, 독일어 더 많은 언어가 계획되어 있습니다. 생성된 음성에 대한 제어도 계획하고 있습니다. 여전히 매우 높은 피치이거나 만화 같은 목소리, 노이즈가 있는 참조 오디오, 그리고 일부 특이한 OOD(Out-of-Distribution) 음성에서는 어려움을 겪습니다. 저희는 이러한 사례들을 계속 개선해 나가고 있습니다. 기여하고 싶거나 도움을 주고 싶은 분은 실패한 샘플과 함께 저에게 개인 메시지(PM)를 보내주세요. F5-TTS가 마음에 들지만, 진정한 스트리밍 기능과 CPU에서 편안하게 실행할 수 있는 훨씬 가벼운 모델을 원한다면 이것이 적합할 수 있습니다. 로컬에서 실행하세요: uvx --from sopro soprotts serve 저장소(Repo): https://github.com/samuel-vitorino/sopro 가중치(Weights): https://huggingface.co/samuel-vitorino/sopro-v2-turbo 인앱 데모 (데스크톱): https://samuel-vitorino.github.io/sopro/ 공간(Space): https://huggingface.co/spaces/samuel-vitorino/sopro-v2-turbo-tts 블로그 (평가, 샘플, 작동 방식): https://research.haloneuro.ai/posts/sopro-v2 비디오: 6개의 음성, 각각 약 5초의 참조 오디오 후 생성된 대사. https://reddit.com/link/1wxfs0d/video/ajs3suw2cgth1/player /u/SammyDaBeast가 제출한 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/StableDiffusion의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기