
초현실적인 경량 텍스트 음성 변환(TTS) 모델 Soprano 발견
요약
80M 파라미터의 초경량 TTS 모델인 Soprano가 공개되었습니다. 1GB 미만의 메모리로 일반 CPU에서도 실시간보다 20배 빠른 속도를 자랑하며, OpenAI 호환 인터페이스를 지원합니다.
핵심 포인트
- 80M 파라미터 및 1GB 미만의 낮은 메모리 점유율
- 일반 CPU에서 실시간 대비 20배 빠른 합성 속도
- 250ms 이내의 낮은 첫 음성 출력 지연 시간(Latency)
- OpenAI 호환 인터페이스 및 CLI/Web UI 지원
- 32kHz 고음질 및 긴 텍스트 자동 분할 합성
애플리케이션에 텍스트 음성 변환 (TTS) 기능을 추가하고 싶지만, 클라우드 인터페이스를 호출하면 인터넷 연결이 필요하고 호출 횟수에 따라 비용이 발생하며, 로컬에서 실행하면 사양이 낮아 출력이 느립니다.
우연히 Soprano를 발견했는데, 이는 매우 사실적인 경량 텍스트 음성 변환 (TTS) 모델로, 파라미터(Parameter)는 80M에 불과하며 메모리 점유율은 1GB 미만입니다.
일반 CPU에서 합성 속도는 실시간의 20배에 달하며, 첫 음성 출력 지연 시간(Latency)을 250밀리초 (ms) 이내로 낮췄습니다.
GitHub: https://t.co/Z6ZxQXSRBf
긴 텍스트는 자동으로 문장을 나누어 한 단락씩 차례대로 합성하며, 길이에 제한이 없고 출력은 32kHz의 선명한 음질을 제공합니다.
OpenAI와 호환되는 인터페이스를 외부에 제공하며, 커맨드 라인(CLI)과 웹 인터페이스 (Web UI)도 지원하여 Windows, Linux, Mac에서 모두 사용할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @github_daily (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기