MH3용 RefMods에 감탄했습니다
요약
본 글은 RefMods라는 도구를 사용하여 이미지와 음성 파일만으로 놀라운 수준의 캐릭터 유사성과 목소리 클론을 생성하는 과정을 소개합니다. 특히 태그 없이도 쉽게 'LoRa'를 만들고, MP3 오디오로 1:1에 가까운 목소리를 복제할 수 있다는 점에 감탄하고 있습니다.
핵심 포인트
- RefMods는 이미지와 음성만으로 LoRa급의 캐릭터 및 목소리 클론을 생성합니다.
- 태그 없이도 높은 얼굴 유사성을 가진 safetensors 파일을 쉽게 만들 수 있습니다.
- MP3 오디오를 이용해 1:1에 가까운 고품질 목소리 복제가 가능합니다.
- ComfyUI 워크플로우 업데이트와 노드 추가로 사용 편의성이 개선되었습니다.
저는 다양한 캐릭터 이미지를 시도해보고, 캐릭터 시트를 만들었고, 물론 i2v를 사용하기도 했습니다. 심지어 목표 달성을 위해 Krea2의 LoRa까지 훈련시켰습니다. 하지만 RefMods를 사용하는 것에는 비할 바가 못 됩니다. 태그 없이 이미지 여러 장만으로 일종의 'LoRa'를 만드는 것이 얼마나 쉬운지, 그리고 어떻게 엄청나게 빠르게 사용할 수 있는 safetensors 파일을 생성해 주는지 정말 당황스럽습니다. 게다가 왜곡이나 아무런 문제 없이 얼굴 유사성이 정말 놀라울 정도입니다. 이건 미쳤어요. 그리고 더 마법 같은 부분이 있습니다. 폴더에 음성 오디오가 포함된 mp3를 던져 넣으면, 똑같은 safetensors 파일로 거의 1:1의 목소리 클론을 만듭니다. 이게 대체 무슨 광기인가요?? 아직 시도해보지 않은 분들은 다음 비디오를 보고 커스텀 노드를 설치하고 워크플로우를 다운로드하여 일어나는 마법에 놀라보세요. 저는 이해할 수 없고, 그럴 필요도 없습니다. 눈으로 보이는 것을 판단하면 그것은 놀랍습니다. 무엇이 일어났는지 아직 파악할 수 없어서 말문이 막힙니다. 어쩌면 이것은 여러분에게 새로운 소식은 아닐 수도 있겠네요. 저는 감탄했습니다. 여기 비디오가 있습니다. 또는 온라인에서 찾을 수 있는 어떤 비디오든 상관없으니 보세요:
수정합니다. 불행히도 오류를 발생시키기 때문에 워크플로우를 업데이트했습니다. 또한 제 취향에 맞게 워크플로우를 다듬어 sage-attention 노드를 제거하고 comfy-kitchen으로 대체했으며, 비디오가 생성되는 과정을 모니터링할 수 있게 해주는 model-preview-override 노드도 추가했습니다. 꽤 멋진 노드입니다. 여기에는 Spectrum Apply Minimax H3 노드도 있는데, 이것을 활성화하면 생성 시간을 절반으로 줄일 수 있습니다. 이는 조정 가능하지만 제 경험상 품질을 희생합니다. 두 번째 워크플로우는 RefMod safetensors 파일 자체를 만드는 것입니다. comfyUI\models\refmod에서 찾을 수 있습니다. 그 후에 Load H3 Refmods 노드를 새로고침하면 로드할 수 있습니다. 여기 있습니다: https://limewire.com/d/JJwWU#if3A6viA0s /u/AlsterwasserHH가 제출했습니다 [링크] [댓글]AI 자동 생성 콘텐츠
본 콘텐츠는 r/StableDiffusion의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기