[audio.cpp] 놓치기 쉬운 최근 업데이트: Higgs Audio TTS VRAM 48% 감소, HTDemucs 및 PocketTTS
요약
audio.cpp에 Higgs Audio TTS VRAM 48% 감소 등 대규모 성능 최적화가 적용되었습니다. 이로써 여러 오디오 모델을 로컬 환경에서 더욱 효율적으로 실행할 수 있게 되었으며, HTDemucs와 PocketTTS 같은 일부 모델은 속도 향상도 이루어졌습니다. 또한 WebUI에 생성 기록 기능이 추가되어 사용 편의성이 개선되었습니다.
핵심 포인트
- Higgs Audio TTS VRAM 48% 감소로 메모리 효율성 대폭 개선
- HTDemucs 및 PocketTTS 등 주요 모델에서 추론 속도 향상 확인
- CUDA, Vulkan, Metal 등 다양한 환경에 걸친 최적화 지속
- WebUI에 생성 기록 기능 추가 및 UI/UX 기여 요청
안녕하세요 여러분, audio.cpp에 여러 성능 개선 사항이 적용되었습니다. 가장 큰 하이라이트는 Higgs Audio TTS인데, 이전 구현 대비 피크 메모리 사용량이 48% 감소하여 이제 약 6 GB VRAM으로 실행됩니다. https://github.com/mirek190 덕분에 저희는 일부 모델을 상당히 빠르게 만들었습니다. 특히 GPU에서의 HTDemucs와 CPU에서의 PocketTTS가 그렇습니다. 동등성(parity)과 정확성에는 타협이 없습니다. 개선 사항 요약은 다음과 같습니다:
| Model | Peak memory reduction | Speedup |
|---|---|---|
| Higgs Audio TTS | 48% VRAM | 1.01–1.09× CUDA |
| ACE-Step family | 6–7% VRAM | 1.06–1.08× CUDA, 1.16–1.20× Vulkan |
| MOSS-TTS v1.5 cloning | 21% VRAM | 1.05× CUDA |
| MOSS-TTSD Q8 cloning | 11% VRAM | 1.04× CUDA |
| Echo-TTS (Memory Saver) | 20% VRAM | — |
| Qwen3-TTS | 16–20% VRAM | — |
| IndexTTS2 / 2.5 | 12% VRAM | — |
| HTDemucs | — | 2.21× CUDA, 1.95× Vulkan |
| HTDemucs six-stem | — | 1.99× CUDA |
| PocketTTS | 9% RAM | 2.23× CPU |
이러한 최적화는 런타임 수준의 개선으로, 기존 모델을 로컬에서 더 실용적으로 실행할 수 있게 합니다. WebUI에는 이제 이전에 생성된 출력을 다시 보고 설정도 복원할 수 있는 실험적인 생성 기록 기능이 포함되었습니다. audio.cpp는 현재 110개 이상의 오디오 모델 패밀리와 190개 이상의 변형(계속 증가 중)을 지원합니다! 저희는 CUDA, Vulkan, Metal, AMD/HIP 및 CPU 전반에 걸쳐 메모리 효율성과 추론 속도를 계속 개선하고 있습니다. 다음 릴리스에서는 더 많은 최적화가 제공될 예정입니다! 또한 audio.cpp WebUI를 개선하는 데 도움을 줄 기여자들을 찾고 있습니다. 이렇게 많은 모델과 기능이 지원되면서, UI를 더욱 세련되고 직관적이며 사용하기 즐겁게 만드는 데 도움이 필요합니다. 프론트엔드 개발이나 UI/UX 디자인에 관심이 있다면 기여해 주시면 대환영입니다! 개선 사항을 기여하고, 빌드를 테스트하며, 문제를 보고해 준 모든 분들께 감사드립니다. 여러분의 환경에서 이러한 변경 사항들이 어떻게 작동하는지 궁금하네요! /u/Acceptable-Cycle4645가 제출했습니다. [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기