YuE2: KSampler 16배 속도 향상 및 장시간 곡 제작 개선 방법과 기타 발견 사항
요약
YuE2 모델을 활용한 음악 생성 워크플로우를 최적화하는 방법을 제시합니다. KSampler의 추론 속도를 최대 16배 향상시키는 방법과, ComfyUI에서 Gemma 4 같은 LLM을 이용해 프롬프트를 초고속으로 증강할 수 있는 기술을 공유했습니다. 또한, 장시간 곡 제작 및 ABC 표기법 편집 기능을 통해 음악 생성의 제어력을 높였습니다.
핵심 포인트
- KSampler 속도를 단계(steps) 감소와 샘플러 변경으로 최대 16배 향상 가능합니다.
- ComfyUI에서 Gemma 4를 이용한 프롬프트 증강이 매우 빨라져 활용도가 높아졌습니다.
- 최대 곡 길이가 360초에서 900초로 증가하여 장시간 음악 제작에 용이합니다.
- ABC 표기법 편집을 통해 생성 전 음악의 구조적 검토 및 수정이 가능해졌습니다.
들어보세요, 워크플로우 전문가 여러분! YuE2가 일주일 전에 출시되었는데, 크기(3B)에 비해 정말 훌륭합니다. 현재 제가 가장 좋아하는 로컬 음악 생성 모델임이 분명합니다. 좋은 소식은 ComfyUI 템플릿과 비교하여 성능과 품질 모두를 개선할 수 있는 몇 가지 방법을 찾았다는 것입니다. 모든 테스트는 저사양/중급 사양 PC(RTX5060 Ti 16GB + 64GB DDR4 RAM)와 Komplete Audio 인터페이스를 통해 ATH-M50x 헤드폰으로 진행했습니다. 더 이상 지체하지 않고 말씀드리겠습니다: KSampler 속도 약 16배 향상 무료로 단계(steps)를 32에서 6으로 줄이는 것만으로도 KSampler 추론 시간이 약 8배 단축됩니다. 샘플러를 dpm_2에서 dpmpp_2m로 변경하는 것만으로도 시간을 추가로 50% 절감하여, 총 거의 16배 빠른 KSampler 추론이 가능합니다! 5분짜리 곡의 경우, 제 PC에서는 34초(1.08s/it)에서 2초(2.32it/s)까지 줄었습니다. 여러 노래에 대한 블라인드 A/B 테스트를 진행했지만 품질 차이를 느낄 수 없었습니다. 하지만 저도 청각적으로 아주 잘 훈련된 것은 아니니, 직접 테스트해 보시고 의견을 알려주세요. CFG는 1 또는 3이 좋을까요? 저는 CFG 값 1부터 20까지 테스트했습니다: CFG 1은 전반적으로 가장 빠르고 안정적입니다. CFG 2는 1과 거의 같은 소리가 나지만 시간이 조금 더 걸리므로, 제 생각엔 가치가 없습니다. CFG 3은 더 크고
PSA: 프롬프트 증강 속도 향상 최근의 성능 개선 덕분에 ComfyUI의 Generate Text 노드에서 Gemma 4(및 일부 Qwen 3.5+) 모델을 사용하는 것이 이전보다 훨씬 빨라졌습니다. 이를 통해 스타일 태그, 가사 등을 생성할 때 초고속 프롬프트 증강이 가능해져 유용합니다. 제 PC에서 Gemma 4 e2b it int8 convrot를 사용하면 스타일 태그와 가사를 모두 생성하는 데 약 10초가 걸리는데, 이는 PR 이전보다 2배 이상 빠르며 클라우드 LLM과 거의 비슷한 속도입니다.
장시간 곡 및 커버 수정 ComfyUI를 업데이트하여 다음 수정 사항을 받으세요: 이 PR 덕분에 최대 곡 길이가 360초에서 900초로 증가했습니다. 또 다른 PR이 병합되어 약 50초 후에 커버가 동기화되지 않던 문제를 수정했습니다.
ABC 표기법 편집 YuE2 조건부(conditioning)는 ABC 표기법으로 된 곡을 받아들일 수 있습니다. 이는 멜로디, 화성, 리듬의 청사진과 같습니다. YuE2 Generate ABC나 SheetSage2 Audio to ABC 같은 노드를 통해 생성할 수 있으며 (이것이 커버를 가능하게 하는 방식입니다). ABC는 단순한 텍스트 파일이기 때문에 편집이 가능하며, 생성에 보내기 전에 곡의 관련 측면을 검토/수정할 수 있습니다.
곡은 마음에 들지만 더 빠르게 만들고 싶나요? Q:에서 후행 숫자를 늘려 템포를 변경하세요 (또는 기본 음표 길이를 변경하려면 L:를 사용하세요). 이것이 제가 이 Super Mario 스카 커버에서 한 것입니다. 다른 키의 커버를 듣고 싶나요? 물론 편집하기가 조금 더 복잡하지만, K:를 변경하여 코드와 음표를 수정함으로써 가능합니다. 이미 사용자 인터페이스를 개선하여 이러한 수정을 제공하는 맞춤형 노드를 개발한 사람들이 있습니다. 이는 생성에 대해 더 많은 제어력을 원할 때 매우 유용합니다.
ComfyUI 워크플로우가 편안하게 느껴지도록 모든 위에서 언급된 발견 사항을 바탕으로 다음 기능을 가진 워크플로우를 만들었습니다:
- 앱 모드 기본 활성화: 가장 중요한 매개변수에만 집중하도록 돕는 사용자 친화적인 UI.
- 네이티브 노드 전용: 맞춤형 노드를 설치할 필요가 없습니다.
모델 자동 다운로드: 이 워크플로우는 ComfyUI가 누락된 모델을 원래 소스에서 다운로드하도록 프롬프트할 수 있도록 구성되어 있습니다. 속도 향상 포함: KSampler가 기본 템플릿보다 16배 빠르게 실행되도록 설정되었습니다. AI로 강화하기: 버튼만 토글하면 로컬이며 가벼운 LLM(기본값은 Gemma 4 e2b)을 통해 스타일과 가사가 자동으로 강화됩니다. 스타일 프리셋: 어떤 장르를 찾고 있는지 모르겠나요? 50개 이상의 인기 스타일 목록에서 하나를 선택하세요 (v2에 더 많은 것을 제안해 주세요). 포함된 품질 LoRA: 위에서 언급한 품질 LoRA의 영향을 제어하는 노브(knobs)가 있습니다. 기존 노래 재구상하기: 커버를 생성하려면 참조 오디오를 제공하세요. 노래 템포 편집하기: 같은 노래를 더 빠르게 할지 느리게 할지 선택하세요 (곧 더 많은 옵션이 있을 것입니다. 기대해주세요!) CIVITAI의 워크플로우 링크 발견한 점은 무엇인가요? 결과를 개선할 팁이 있나요? 가장 좋아하는 LLM 시스템 프롬프트는 무엇인가요?? 최고의 LoRA 학습 매개변수를 찾았나요??? 커뮤니티와 함께 발견한 점을 공유하고 모두가 이득을 보세요. 제가 할 말은 여기까지입니다. 다음 Supernova까지! [전송 종료.] /u/Diligent-Rub-2113 제출 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/StableDiffusion의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기