Scylla의 Band 소개: 새로운 TTS 모델 및 Android 샘플을 포함한 추론 프레임워크!
요약
Scylla의 Band는 모바일 환경에 최적화된 새로운 TTS(Text-to-Speech) 추론 프레임워크입니다. 10개의 음성과 7가지 감정 설정을 지원하며, Android 샘플 앱을 통해 실시간 스트리밍 오디오를 제공합니다.
핵심 포인트
- 모바일 기기(Android, Mac)에서 최적화된 경량 TTS 모델 제공
- 영어, 스페인어, 이탈리아어 3개 언어 및 다양한 감정 제어 지원
- LiteRT, ONNX 기반의 크로스 플랫폼 추론 스택 구축
- 텍스트 정규화를 위한 C++ 라이브러리 및 자체 G2P 모델 활용
안녕하세요 여러분! https://github.com/lowkeytea/scyllasband -> 추론 (inference) 코드 https://huggingface.co/spybyscript/scyllasband -> 모델, LiteRT, ONNX 및 음성(voices) https://lowkeytea.github.io/scyllasband/ -> 음성, 감정 및 언어 샘플 오디오. 요약하자면: 10개의 음성, 7개의 설정 가능한 감정 (sentiment/emotion) 설정, 그리고 모든 음성에 대해 영어, 스페인어, 이탈리아어의 3개 언어를 지원합니다. Samsung Fold 7에서 첫 오디오가 나오기까지의 시간은 약 500~800ms입니다. 그 이후에는 끊김 없이 오디오가 연속적으로 스트리밍됩니다. 영어의 경우, 음성은 en_us 또는 en_gb를 기반으로 합니다. 리포지토리(repo)에 라벨이 붙어 있지만, 추론 (inference) 코드에서 방언 차이를 강제하지는 않습니다. **** 테스트 **** 이것은 Linux와 Mac에서 개발되었으며, Linux, MacOS, Android에서 테스트했습니다. Mac의 경우 M2, M4, M5 하드웨어에서 테스트했습니다. Android의 경우 제가 가진 유일한 Android 폰인 Fold 7에서 테스트했습니다. 아직 iOS 예제 앱을 만들지는 않았지만, 리포지토리에 직접 빌드하고 설치할 수 있는 Android 샘플 앱이 있으며, 이를 통해 음성, 언어, 감정을 즉석에서 동적으로 전환할 수 있는 텍스트를 생성할 수 있습니다. **** 더 자세한 내용을 원하신다면 **** 이것은 새로운 모델을 출시하는 대기업의 작업이 아닙니다. 저는 지난 6개월 동안 모델을 구축하는 법을 독학하며, 일관성 문제가 있거나 성능 목표를 달성할 수 없었던 여러 가지 완전히 다른 설계들을 포함하여 막다른 길로 이어지는 끝없는 변형 과정을 거쳤습니다. 이번 출시는 제가 스스로 설정한 대부분의 기본 요구 사항을 마침내 달성했음을 의미합니다: 모바일에서 Kokoro의 성능과 일치하거나 능가할 것. 모바일에 충분히 가벼우면서도 좋은 오디오 품질을 제공할 것. eSpeak 사용을 피할 것. 저는 미국 및 영국 영어, 이탈리아어, 스페인어를 위해 데이터셋을 구축하고 DeepPhonemizer ( https://github.com/axelspringer/DeepPhonemizer )를 기반으로 한 G2P 모델을 학습시켰습니다. 저는 라이선스를 제어하는 동시에 추가적인 음소(phoneme) 기반 언어들을 지원할 수 있다는 확신을 원했습니다.
어느 정도 수준의 감정(sentiment) 및 정서적 제어(emotional control)를 제공하고자 하며, 이는 제가 시간이 지남에 따라 반드시 개선하고 싶은 부분입니다. 다국어를 지원하여, 적어도 이것이 영어를 넘어설 수 있음을 증명할 수 있을 만큼의 언어를 지원하고자 합니다. 궁극적으로는 음성 복제(voice cloning)를 지원할 것입니다. 이번 릴리스는 최소한 이 첫 다섯 가지 요구 사항을 충족합니다. 성능과 품질의 일부는 추론 스택(inference stack)을 직접 구축한 것에서도 비롯됩니다. 여기에는 텍스트 정규화(text normalization)를 위한 C++ 라이브러리, ONNX 또는 LiteRT를 통한 추론, 그리고 코드를 크로스 플랫폼(cross-platform) 호환성을 유지하면서 성능을 향상시키기 위한 여러 가지 최적화 기술이 포함되어 있습니다. 제가 혼자서 이 작업을 진행하고 있기 때문에, 향후 지원 여부는 제가 얼마나 더 많은 시간과 에너지를 투자하기로 결정하느냐에 달려 있습니다. 현재 상태로도 이미 충분히 사용 가능하다고 생각하며, 더 많은 언어를 추가하고, 정서적 제어를 개선하며, iOS 샘플 앱을 만들고 싶지만, 아직 약속을 드릴 수는 없습니다. 6번 항목인 음성 복제(voice cloning)에 대해서는, 그 기능을 제대로 작동하게 만드는 것에 대해 계속 고민해 왔습니다. 만약 제가 성능 범위(performance envelope) 내에서 음성 복제를 구현하게 되더라도(현재는 주로 음색/피치 수준입니다), 제가 그것을 출시하는 데 책임을 지고 싶지는 않습니다. 저의 목표는 고성능이며, 소리가 좋고, 실행되는 장치에서 다른 작업을 수행할 수 있도록 메모리를 너무 많이 차지하지 않는 모델을 만드는 것입니다. 지금으로서는 특히 어떠한 피드백이라도 주시면 감사하겠으며, 누구나 리포지토리(repo)에 이슈(issues)나 댓글(comments)을 남겨주시길 권장합니다! 제출자: /u/clockentyne [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기