
3초 오디오로 음성을 복제하고 646개 언어를 구사하는 완전 로컬 ElevenLabs 대안 제작
요약
3초 오디오 클립으로 음성을 복제하고 646개 언어를 지원하는 완전 로컬 ElevenLabs 대안이 공개되었습니다. 이 도구는 API 키나 구독 없이 자체 GPU 환경에서 작동하며, 개인 정보 보호와 상업적 사용에 대한 고려 사항을 제시합니다.
핵심 포인트
- 3초 오디오로 음성 클론화 및 646개 언어 지원
- 완전 로컬 구동으로 데이터 전송 걱정 없음 (프라이버시 강화)
- API 키, 구독 없이 자체 GPU 환경에서 사용 가능
- 베타 버전이며 상업적 사용 시 라이선스 확인 필수
누군가 3초의 오디오에서 목소리를 클론화하고 646개 언어를 말할 수 있는 완전히 로컬(local)인 ElevenLabs 대안을 만들었습니다.
계정, API 키, 구독, 사용량 측정기 없이 사용할 수 있습니다. 하드웨어만 제공하면 나머지는 알아서 처리합니다.
짧은 목소리 클립을 넣고, 텍스트를 입력하고, 언어를 선택하면 자체 기기에서 생성됩니다. 원래 화자를 유지하면서 음성을 복제하고 전체 비디오에 더빙할 수 있으며, 옵트인(opt-in)하지 않는 한 아무것도 컴퓨터 외부로 전송되지 않습니다.
아직 베타 버전이며 실제 GPU가 필요하고, 기본 가중치(default weights)는 cc-by-nc이므로 상업적 사용 전에 라이선스를 확인하세요.
유료 등급은 없고 기부만 받습니다. 15,600개의 스타, 2,100개의 포크, 하루 만에 832개의 스타를 기록하며 오늘 GitHub에서 트렌딩 중입니다.
모든 호스팅되는 음성 서비스는 사용량을 측정합니다(meter). 하지만 이 서비스는 이미 소유하고 있는 GPU만 요구할 뿐입니다.
링크는 아래 댓글을 확인하세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @thewhizzai (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기