![[audio.cpp] 0.4 버전 출시: Higgs Audio v3 TTS 4B (실시간 대비 10배 속도) + C++/GGML 기반 Fish 대표 이미지](https://preview.redd.it/5s6gxql7n2fh1.png?width=140&height=57&auto=webp&s=8ff2f520a05742890ac13fe612432c35634d78a5)
[audio.cpp] 0.4 버전 출시: Higgs Audio v3 TTS 4B (실시간 대비 10배 속도) + C++/GGML 기반 Fish
요약
audio.cpp 0.4 버전이 출시되어 Higgs Audio v3 TTS 4B 등 고품질 모델 지원과 GGUF 포맷의 전면 도입을 발표했습니다. C++/GGML 기반의 최적화를 통해 실시간 대비 최대 10배 빠른 속도와 VRAM 절감 효과를 제공합니다.
핵심 포인트
- Higgs Audio v3 TTS 4B 등 35개 모델 제품군 지원
- GGUF 포맷 지원으로 Q8 양자화 시 VRAM 최대 37% 절감
- RTX 5090 테스트 결과 실시간 대비 약 8.5~10배 빠른 속도 구현
- 커뮤니티 모델 전용 영역 신설로 모델 포팅 생태계 확장
audio.cpp가 다시 돌아왔습니다 :) 0.4 버전이 출시되었습니다. 이번 업데이트의 핵심은 새로운 고품질 TTS 지원과 프로젝트 전반에 걸쳐 GGUF가 일급 시민(first-class)으로 자리 잡았다는 점입니다.
새로운 기능:
Higgs Audio v3 TTS 4B, Fish Audio S2 Pro, Voxtral Realtime ASR, 그리고 커뮤니티 모델인 OuteTTS TTS와 VieNeu-TTS-v3가 추가되었습니다. 이제 audio.cpp는 35개의 모델 제품군(model families)을 지원합니다. 출시된 모든 모델 제품군은 이제 GGUF를 지원합니다. 즉시 사용 가능한 GGUF 패키지를 이용할 수 있으며, Q8은 여러 경로에서 실제적인 속도 및 메모리 이점을 보여주기 시작했습니다. 수치를 확인해 보세요.
'Long-lived session'은 워밍업(warmup) 후 여러 번의 요청을 수행하는 것을 의미합니다. 'Longform'은 한 번에 6,000자 이상의 텍스트를 생성하는 것을 의미합니다.
RTX 5090에서 테스트되었습니다. 현재 측정된 CUDA Q8 GGUF 수치는 다음과 같습니다:
- Higgs Audio TTS: 워밍업된 요청은 실시간보다 약 8.8배~10.1배 빠릅니다. Longform은 실시간보다 약 8.5배 빠릅니다.
- Fish Audio S2 Pro: 워밍업된 요청은 실시간보다 약 3.1배~3.4배 빠릅니다. Longform은 실시간보다 약 3.3배 빠릅니다.
구현 방식이 프레임워크 템플릿을 단순하게 적용한 것이라 개선의 여지는 충분합니다.
- Voxtral ASR: 오프라인 실행 시 실시간보다 약 15.7배 빠르며, 스트리밍 TTFT(Time To First Token)는 약 171ms입니다.
16-bit GGUF와 비교했을 때, Q8이 모든 상황에서 마법처럼 작동하는 것은 아니지만 현재 매우 유용합니다. 테스트된 릴리스 경로에서 Q8은 모델과 경로에 따라 최대 약 1.5배 더 빠를 수 있으며, 피크 VRAM(peak VRAM)을 최대 약 37%까지 줄일 수 있습니다.
품질은 여전히 모델마다 다르므로, 모든 양자화(quant)가 어디서나 안전하다고 주장하는 대신 GGUF 지원 매트릭스와 Q8 성능 보고서를 계속 공개해 두겠습니다. (Qwen3-TTS와 같은 일부 모델의 성능을 최대 2배까지 더 높이는 팁: 청크 크기(chunk size)를 조정하고 참조 오디오(reference audio) 길이를 자르세요.)
이제 audio.cpp에는 아직 성숙 단계에 있더라도 유용하고 실행 가능한 포팅 모델들을 위한 전용 커뮤니티 모델(community models) 영역이 있습니다. 이곳의 검토 기준은 핵심 프레임워크보다 완화되어 있습니다. 만약 audio.cpp에 가져오고 싶은 모델이 있다면, 먼저 프레임워크 모듈과 패턴을 사용하여 커뮤니티 모델로 구현해 보세요.
모델을 포팅하고, 최적화하며, 새로운 기능을 추가하고, 프로젝트를 앞으로 나아가게 해준 기여자분들께 진심으로 감사드립니다. Repo: https://github.com/0xShug0/audio.cpp /u/Acceptable-Cycle4645 님이 제출함 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기