
RTX 5090 로컬 환경에서 캐릭터가 무너지지 않는 풀 코러스 AI MV를 제작한 전체 공정
요약
RTX 5090 로컬 환경에서 클라우드 서비스 없이 동일한 캐릭터의 일관성을 유지하며 풀 코러스 AI MV를 제작하는 전체 공정을 소개합니다. 비용 절감, 고유 캐릭터 사용, 데이터 보안 및 연출의 자유도를 위해 로컬 워크플로우를 제안합니다.
핵심 포인트
- 로컬 GPU를 활용해 비용 효율적이고 무제한적인 AI 영상 생성 가능
- LoRA와 이미지 모델을 활용한 캐릭터 일관성 유지 기술
- 립싱크 정교화를 위한 보컬 트랙 분리(구동용/감상용) 전략
- 컷 구성 및 프레임 단위 설계를 통한 고품질 MV 연출
클라우드 월정액 서비스를 사용하지 않고, 집의 GPU 1대만으로 동일한 캐릭터가 처음부터 끝까지 무너지지 않고 노래하는 풀 코러스(Full Chorus) MV를 만들었다. 이 기사에서는 그 전체 공정을 '지도'로서 처음부터 끝까지 공개한다.
각 공정의 세부 설정값이나 실제로 저지른 실수에 대한 회피책까지는 다 적을 수 없으므로, 그것은 별도로 정리해 두었다(말미). 이 기사는 "무엇을, 어떤 순서로 하는가"의 전체상이다.
완성된 것
- 한 명의 동일한 캐릭터가 곡의 시작부터 끝까지 얼굴도 체형도 옷도 무너지지 않고 등장한다
- 가사에 맞춰 입이 움직인다 (가창 립싱크 (Singing Lip-sync). 사용할지는 곡과 연출에 따라 선택한다)
- 풀샷(引き), 클로즈업(寄り), 바스트 업(バストアップ), 전신(全身) 등 여러 컷 구성으로, 지루한 단일 컷 고정 화면이 아니다
- 720p~1080p 네이티브, AI스러운 느낌(플라스틱 같은 피부, 부자연스러운 움직임)을 억제한 완성도

가창 립싱크를 사용한 작품의 연속 컷. 컷이 바뀌어도 동일 인물인 채로 계속 노래한다 (모두 AI 생성 · 가공의 성인 캐릭터)
완성형이 어느 정도인지 확인하려면 한 편을 통째로 보는 것이 빠르다. 여름 축제를 무대로 한 약 3분의 MV로, 컷 설계 · 캐릭터의 일관성 · 가사 자막 · 엔드롤까지 한 편에 담겨 있다.
이 작품은 이 기사에서 쓰는 공정을 그대로 따른 것은 아니다. 가창 립싱크도, 후술할 "한 장에서 잘라내기" 방식도 사용하지 않았다. 로컬 환경에서 3분의 MV를 완성하면 이렇게 된다는 도달점의 예로 봐주길 바란다. 수법은 작품마다 골라가며 사용하고 있다.
왜 클라우드 편리 서비스를 사용하지 않는가
Freebeat나 Neural Frames라면 곡을 넣는 것만으로 립싱크 MV가 나온다. 그럼에도 로컬에서 하는 이유는 4가지다.
- 비용: 클라우드는 월정액 + 생성량 과금. 만들수록 청구 금액이 늘어난다. 로컬은 전기세만으로 무제한 생성 가능
- 자신의 캐릭터: 프리셋 아바타가 아니라, 직접 학습시킨 고유 캐릭터를 주인공으로 할 수 있다
- 데이터가 수중에 있음: 곡도 캐릭터도 소재도 외부 서버로 보내지 않는다
- 표현의 자유도: 컷 단위로 연출을 정교하게 만들 수 있다
반대로 "한 번만 한다 · 캐릭터는 아무래도 좋다 · 빠르게 한다"라면 클라우드가 합리적이다. 로컬은 "자신의 작품을, 반복해서, 수중에 만들고 싶은" 사람을 위한 선택이다.
전체 플로우

순서대로 살펴보자.
① 곡의 밑준비
의외의 함정이 처음에 있다. 보컬을 2종류로 분리해 두어야 한다.
- 구동용 (주선율만): 립싱크를 움직이는 소리. 화음이나 추임새가 섞이면 입이 오작동한다
- 감상용 (Full): 최종적으로 MV에 얹을 소리. 화음을 포함한 풀 곡이면 된다
"입을 움직이는 것은 주선율 / 귀에 들리는 것은 풀 곡". 이것을 하나로 해결하려 하면 반드시 어느 한쪽이 파탄 난다. 아울러, 곡을 '초'가 아니라 '프레임(Frame)' 단위로 나눈 지도를 만든다 (동영상 모델에는 프레임 수의 제약이 있으며, 초 지정은 반올림되기 때문이다).
② 캐릭터를 만든다
이미지 모델 (Z-Image 계열)과 캐릭터 LoRA로 후보를 몇 장 뽑는다. 여기서 중요한 것은, LoRA만으로는 일관성을 지킬 수 없다는 사실이다. LoRA는 "그 캐릭터 같은 사람"을 내보내지만, 생성할 때마다 세부 사항은 흔들린다. 그러므로 후보를 뽑았다면, 마음에 드는 1장을 "확정"한다.
③ 마스터를 확정한다 (이 부분이 모든 운명을 결정한다)
이 기사에서 가장 전달하고 싶은 것이 여기다. 일관성은 "재생성"으로는 절대로 얻을 수 없다.
같은 프롬프트라도 생성할 때마다 얼굴은 미묘하게 변한다. 5컷을 생성하면 5명의 "닮았지만 다른 사람"이 생긴다. 인간의 뇌는 얼굴의 미세한 차이에 민감하기 때문에, 나란히 재생하면 순식간에 들통난다.
해결책은 "매번 뽑기"를 그만두고 "1장에 고정해서 돌려쓰기"를 하는 것이다.
- 확정된 1장을 고해상도화 (2배) 한다
- 그 고해상도 마스터로부터 closeup / bust / knee / full 을 crop(자르기)으로 잘라낸다
- 이후의 모든 컷은 이 소재로 만든다.
- 두 번 다시 재생성하지 않는다
다른 각도가 필요할 때도 "별도 생성"이 아니라 "1장에서 잘라내기"를 한다. 잘라내기는 비파괴 조작이므로 얼굴은 절대로 변하지 않는다. closeup도 full도 동일한 1장의 다른 부분이기 때문에 100% 동일 인물이 된다.
초보자가 처음에 반드시 저지르는 실수는, "더 좋은 얼굴이 나올 거야"라며 재생성을 반복하다가 어느샌가 모든 컷이 미묘하게 다른 사람이 되어 있는 것이다. 이 공정은 그 함정을 구조적으로 피하기 위해 짜여 있다.
④ 콘티를 짠다
곡의 구조(Intro/A메로/사비)에 컷을 할당하고, 각 컷에 「역할·사이즈·앵글·감정·시선」을 결정한다. 정면·아이 레벨(Eye level)·바스트 업(Bust up) 위주로만 구성하면 SNS에서 흔히 보이는 단조로운 화면이 되므로, 로우 앵글(Low angle)로 올려다보거나 더치 앵글(Dutch angle)로 질주감을 내는 등 의도적으로 변화를 준다. 이 모든 것은 전부 동일한 마스터 소스에서 잘라낸 소재와 카메라 기술(Camera description)을 통해 차별화할 수 있다.
⑤ 컷을 생성한다
- 노래하는 컷 → 오디오 구동(S2V 계열)으로 입 모양을 맞춘다. 여기서 ①에서 만든 「주선율만 있는 음성」이 효과를 발휘한다.
- 움직이는 컷 → I2V(정지 영상을 움직이게 함)나 포즈 구동
립싱크(Lip sync) 작업 시 가장 흔히 저지르는 실수는 긴 컷을 「하나의 거대한 처리 창(Processing window)」으로 돌리려고 하는 것이다. 이 경우 VRAM이 넘쳐서 20분이 지나도 끝나지 않는다. 올바른 방법은 고정된 크기의 창을 조금씩 겹치며 슬라이드시키는 것이다.
⑥ 수정한다
다시 확인하다 보면 반드시 "이 컷만 신경 쓰이는데"라는 부분이 생긴다. 이때 전편을 다시 만들어서는 안 된다. 한 컷이 마음에 들지 않는다고 전체를 재생성하면, 기존에 좋았던 다른 컷들까지 다른 결과물로 변해버려 ③에서 고정해둔 일관성이 붕괴된다. 수정 사항은 반드시 "그 컷만" 고쳐야 한다.
⑦ 마무리한다
업스케일(Upscale)(소재의 종류에 따라 툴을 바꾼다. 여기서 잘못하면 피부가 무지개색으로 깨지는 함정이 있다), 모든 컷의 색감을 한 방향으로 통일시킨 뒤, ①의 「듣기용 풀 곡」을 얹어서 출력한다.
소요 시간
RTX 5090 기준으로, 노래하는 컷 1개(약 9초)의 생성에 8분 전후가 소요된다. 3분짜리 MV라면 유니크하게 생성해야 하는 컷은 1014개 정도(재사용이나 연장으로 길이를 조절)이며, 순수 생성 시간은 1.52시간 정도다. 여기에 설계·확인·수정·편집 시간이 추가된다. 숙련되면 "하루에 1개"는 현실적이지만, 첫 번째 작업은 공정을 익히는 데만 며칠이 걸릴 것이라고 생각하는 게 좋다.
이 기사에서 다 쓰지 못한 것
전체적인 지도는 이상이지만, 실제로 제작하다 보면 시간의 90%는 "단독으로는 작동하는데, 묶어서 실행하면 무너지는 것"과의 싸움이 된다. 얼굴이 다른 사람이 된다. 옷이 바뀐다. 입 모양이 맞지 않는다. VRAM이 넘친다. 속도를 높이면 표정이 무너진다.
그 하나하나의 구체적인 설정값과, 실제로 실수하여 원인을 찾아낸 실패 회피책을 체계적인 교재로 정리했다. 특히 「실패 패턴 대전」 장은 성공 사례만 실리는 무료 기사에는 절대 쓸 수 없는 내용으로 구성되어 있다.
→ 교재 「로컬 AI MV 스튜디오 교과서」(PDF 62페이지·9,800엔)
우선 이 기사의 공정을 머릿속에 넣고, 자신만의 첫 번째 작품을 만들어 보길 바란다. 막힌다면 그 너머에 지도가 있다.
GPU별로 무엇을 할 수 있고 몇 분을 기다려야 하는지는 이곳에 정리해 두었다.
립싱크 시 입 모양이 맞지 않는 원인(음성 준비)은 이곳을 참고하라.
Discussion

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기