[audio.cpp] 놓치기 쉬운 최근 업데이트: Higgs Audio TTS VRAM 48% 감소 (< 6GB), HTDemucs 2.2배
요약
audio.cpp가 다양한 오디오 모델의 성능을 대폭 개선했습니다. 특히 Higgs Audio TTS는 VRAM 사용량을 48% 줄여 약 6GB로 실행 가능하며, HTDemucs는 CUDA에서 2.2배의 속도 향상을 보여줍니다. 이러한 최적화 덕분에 기존 모델들을 로컬 환경에서 더욱 실용적으로 사용할 수 있게 되었습니다.
핵심 포인트
- Higgs Audio TTS VRAM 사용량 48% 감소 (약 6GB)
- HTDemucs는 CUDA에서 최대 2.2배 속도 향상 달성
- 다양한 플랫폼(CUDA, Vulkan 등) 전반에 걸친 최적화 진행
- WebUI에 생성 기록 및 설정값 복원 기능 추가
안녕하세요 여러분, audio.cpp에 여러 성능 개선 사항이 적용되었습니다. 가장 큰 하이라이트는 Higgs Audio TTS인데, 이제 이전 구현 대비 피크 메모리 사용량이 48% 감소하여 약 6GB VRAM으로 실행됩니다. https://github.com/mirek190 덕분에 저희는 모델들을 상당히 빠르게 만들었으며, 특히 GPU에서의 HTDemucs와 CPU에서의 PocketTTS가 그렇습니다. 동등성(parity)과 정확도(correctness) 면에서 타협은 없습니다. 개선 사항을 요약하면 다음과 같습니다:
| Model | Peak memory reduction | Speedup |
|---|---|---|
| Higgs Audio TTS | 48% VRAM | 1.01–1.09× CUDA |
| ACE-Step family | 6–7% VRAM | 1.06–1.08× CUDA, 1.16–1.20× Vulkan |
| MOSS-TTS v1.5 cloning | 21% VRAM | 1.05× CUDA |
| MOSS-TTSD Q8 cloning | 11% VRAM | 1.04× CUDA |
| Echo-TTS (Memory Saver) | 20% VRAM | — |
| Qwen3-TTS | 16–20% VRAM | — |
| IndexTTS2 / 2.5 | 12% VRAM | — |
| HTDemucs | — | 2.21× CUDA, 1.95× Vulkan |
| HTDemucs six-stem | — | 1.99× CUDA |
| PocketTTS | 9% RAM | 2.23× CPU |
이러한 최적화는 런타임 수준의 개선으로, 기존 모델들을 로컬에서 더 실용적으로 실행할 수 있게 해줍니다. WebUI에는 이제 이전 출력을 다시 보고 설정값을 복원할 수 있는 실험적인 생성 기록(generation history) 기능이 포함되었습니다.
audio.cpp는 현재 110개 이상의 오디오 모델 패밀리와 190개 이상의 변형(계속 증가 중)!을 지원합니다! 저희는 CUDA, Vulkan, Metal, AMD/HIP, 그리고 CPU 전반에 걸쳐 메모리 효율성과 추론 속도를 계속 개선하고 있습니다. 다음 릴리스에서는 훨씬 더 많은 최적화가 제공될 예정입니다!
또한 audio.cpp WebUI를 개선하는 데 도움을 줄 기여자들을 찾고 있습니다. 이제 너무 많은 모델과 기능이 지원되면서, UI를 더욱 세련되고 직관적이며 사용하기 즐겁게 만드는 데 도움이 필요합니다. 프론트엔드 개발이나 UI/UX 디자인에 관심이 있으시다면, 기여는 매우 환영합니다!
개선 사항을 기여하고, 빌드를 테스트하며, 문제를 보고해 주신 모든 분들께 감사드립니다. 여러분의 환경에서 이러한 변경 사항들이 어떻게 작동하는지 궁금하네요! /u/Acceptable-Cycle4645에 의해 제출됨 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/StableDiffusion의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기