
audio.cpp 0.5 출시: DramaBox 표현력 있는 TTS, Confucius4 교차 언어 음성 전이, 그리고 7개의 추가 모델 및
요약
audio.cpp 0.5 버전이 출시되었습니다. 프롬프트를 통해 감정과 행동을 제어하는 DramaBox 모델과 교차 언어 음성 전이를 지원하는 Confucius4 모델이 포함되었습니다.
핵심 포인트
- DramaBox: 프롬프트 기반의 감정 및 음성 연기 제어 가능
- Confucius4: 교차 언어 음성 전이 기술 지원
- LTX-2.3 오디오 아키텍처 기반의 모델 구축
- 오디오 모델 최적화 및 로컬 추론 개선을 위한 기여 요청
audio.cpp 0.5가 출시되었습니다 :) 0.5 버전에서 가장 재미있는 새로운 모델은 DramaBox입니다. 이는 프롬프트 기반의 음성 연기 (voice acting)에 더 가깝습니다. DramaBox는 LTX-2.3 오디오 아키텍처 (audio architecture)를 기반으로 구축되었으며, 프롬프트를 통해 감정, 전달 방식, 웃음, 한숨, 일시 정지, 전환 및 화자의 행동을 제어할 수 있습니다. 입력 예시 (게시물의 오디오를 확인하세요): 긴장한 젊은 남자가
모델의 수가 증가함에 따라, 검증된 성능 패턴을 백포트 (backport)할 시간을 찾는 것이 점점 더 어려워지고 있습니다. 이 분야에서의 좋은 기여는 범위가 명확하고 측정 가능한 최적화입니다. 즉, 하나의 모델 경로를 개선하고, 전후 벤치마크 (benchmarks)를 보여주며, 적절한 경우 perf_mode 뒤에 공격적인 변경 사항을 제한하는 방식입니다. UI / Web UI: 저는 Python WebUI를 가볍고 휴대 가능한 대안으로 교체하고 싶습니다. UI 작업을 즐기신다면, 이 부분에서의 도움은 큰 차이를 만들어낼 것입니다. 오디오 모델을 포팅하거나, 모델을 최적화하거나, 로컬 오디오 추론 (inference)을 덜 고통스럽게 만드는 데 도움을 주고 싶다면, 여러분의 참여를 진심으로 환영합니다! submitted by /u/Acceptable-Cycle4645 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기