
Scenema Audio가 ComfyUI에 출시되었습니다, 8GB VRAM에서 실행 가능
요약
Scenema Audio가 ComfyUI용 네이티브 커스텀 노드로 출시되었습니다. 8GB VRAM에서도 실행 가능하도록 양자화되었으며, 제로샷 음성 복제와 감정 표현이 가능한 TTS 기능을 제공합니다.
핵심 포인트
- 8GB VRAM 환경에서도 구동 가능한 양자화 모델 지원
- 제로샷 음성 복제 및 감정 표현(분노, 슬픔 등) 가능
- 대괄호 형태의 인라인 무대 지시어(Stage direction) 지원
- ComfyUI 커스텀 노드 형태로 간편한 설치 및 사용
여러분 안녕하세요! Scenema Audio가 이제 ComfyUI 네이티브 커스텀 노드(custom node)로 출시되었습니다. scenema.ai를 구동하는 것과 동일한 모델이 8GB VRAM에 맞게 양자화(quantized)되었습니다. 몇 달 전 API 및 Docker 스택으로 처음 출시했을 당시에는, 전체 정밀도(full precision)의 트랜스포머(transformers) 모델이 너무 무거워 대부분의 사용자가 직접 호스팅하기에 어려움이 있었습니다. 이제 그 문제가 해결되었습니다.
제로샷 음성 복제(zero-shot voice cloning) 기능을 갖춘 표현력 있는 텍스트 음성 변환(text-to-speech, TTS)을 경험해 보세요. 음성이 어떻게 수행되어야 하는지(분노, 슬픔, 아이의 경이로움 등)를 설명하고, 선택적으로 음성 정체성을 위한 참조 오디오(reference audio)를 제공하면 모델이 연기를 생성합니다. [he laughs softly](그가 부드럽게 웃는다) 또는 [voice cracks](목소리가 갈라진다)와 같은 인라인 무대 지시어(inline stage direction cues)는 해당 지점에서 정확하게 수행됩니다. 드롭다운 메뉴에는 억양, 연령, 감정 레지스터(emotional registers)를 아우르는 12개의 프리셋 음성이 포함되어 있습니다.
또한 기존 출시 버전에서 사용했던 XML 프롬프트 형식을 폐기했습니다. 모든 연기 지시어를 태그로 감싸는 방식은 작성하기 번거로웠습니다. 인라인 대괄호 지시어(Inline bracket cues)가 ComfyUI 텍스트 에디터에 더 적합합니다.
ComfyUI Registry 설치 (권장): ComfyUI Manager를 열고, Custom Nodes Manager에서
일반적인 입력은 일반적인 결과물을 생성합니다. 고유 명사나 까다로운 단어의 경우 음성 철자 (Phonetic spelling)를 사용하면 도움이 됩니다 (예:
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기