좀비 트렌드 영상의 얼굴이 달라 보이는 이유와 해결 방법
요약
AI 비디오 모델을 사용하여 트렌드 영상을 제작할 때, 인물의 얼굴이 일관성을 잃는 현상이 흔하게 발생합니다. 이는 모델이 원본 이미지의 정보를 상상으로 채우고 여러 샷을 독립적으로 생성하기 때문에 생깁니다. 본 글은 이러한 문제의 근본적인 원인과 이를 해결하기 위한 구체적이고 실용적인 방법을 제시합니다.
핵심 포인트
- 여러 샷을 만들 때마다 모델이 얼굴을 재구성하므로 일관성이 떨어집니다.
- 각 프롬프트에 인물 설명을 정확히 붙여넣고, 같은 의상이나 '앵커' 물체를 유지하세요.
- 클립 길이를 짧게(약 4초) 유지하고, 정지 이미지를 먼저 만들어 유사성을 확인하는 것이 좋습니다.
- 좀비처럼 과도하게 변형된 모습은 모델이 인물 정보를 놓치기 쉽습니다.
당신은 좀비 트렌드 영상을 만들었습니다. 재(ash)를 뿌리고, 포옹하는 장면, 그리고 해변으로 급격하게 전환되는 장면까지요. 그런데 그 안에 있는 사람이 당신 사촌처럼 보이거나, 첫 번째 샷에서는 당신 같다가 세 번째 샷에서는 완전히 낯선 사람처럼 보입니다.
이것은 트렌드에 대한 가장 흔한 불만 사항이며, 거의 나쁜 운 때문이 아닙니다. AI 비디오 모델은 몇 가지 예측 가능한 방식으로 얼굴을 잃게 되며, 각각의 문제에는 해결책이 있습니다. 본 게시물에서는 원인(why)을 다루고, 가장 많은 크레딧을 절약할 수 있는 순서대로 해결 방법들을 제시합니다.
요약 버전 (체크리스트):
- 사진 한 장에 사람 한 명만 배치하고, 카메라를 바라보게 하며, 자연광 아래에서 필터 없이 촬영한다.
- 자르기(cropping) 후에도 얼굴이 사진 높이의 최소 3분의 1을 채우도록 한다.
- 비디오를 만들기 전에 먼저 정지 이미지(still image)를 만들고 유사성을 확인한다.
- 각 인물에 대한 설명(description)을 모든 프롬프트에 단어 하나 틀리지 않게 붙여넣는다.
- 모든 샷에서 같은 옷과 하나의 '앵커' 물체(반지, 스카프, 칼라 등)를 유지한다.
- 각 샷의 길이를 짧게, 약 4초 정도로 유지한다.
- 점진적으로 변하는 모습: 회색 피부와 흐릿한 눈을 표현하고, 단순히 '썩어가는' 모습을 피한다.
- 유사성은 좀비 장면이 아닌 따뜻한 엔딩 장면에서 판단한다.
1. 애초에 얼굴이 바뀌는 이유
이미지-투-비디오(image-to-video) 모델은 당신의 평평한 사진 한 장을 받습니다. 나머지 모든 것, 즉 당신의 프로필, 웃을 때의 치아, 얼굴 움직임 등은 모델이 스스로 상상해야 합니다. 이 상상이 잘못되게 만드는 네 가지 요인이 있습니다:
- 모든 샷이 처음부터 시작된다. 만약 네 개의 샷을 따로 생성한다면, 모델은 당신의 얼굴을 네 번 재구성합니다. 작은 추측들이 쌓여서 마지막 샷에서는 원래 모습과 달라지게 됩니다.
- 길이가 문제를 악화시킨다. 하나의 클립 내에서 프레임이 시작 프레임으로부터 멀어질수록, 원본 사진과의 연결성이 떨어집니다. 10초짜리 샷은 4초짜리 샷보다 더 많이 변형됩니다.
- 좀비 모습이 단서를 제거한다. 피부색, 눈 색깔, 입술 색깔은 누군가가 누구인지를 알려주는 가장 강력한 신호 중 일부입니다. 회색 피부와 흰 눈은 이러한 신호를 없애버려, 모델이 당신에 대한 정보 대신 '좀비'라는 자체적인 개념에 의존하게 만듭니다.
- 두 사람이 하나의 프롬프트를 공유한다. 같은 프레임에 두 사람이 있을 경우, 세부 묘사가 그들 사이에서 새어 나올 수 있습니다: 한 사람의 수염이 다른 사람에게 나타나거나, 다른 사람의 머리 색깔이 그에게 나타나는 식입니다.

상단: 같은 남자가 장면마다 재생성되면서 점차 다른 사람처럼 변한다. 하단: 같은 남자를 참조 사진과 고정된 설명으로 구현했다. AI로 생성한 이미지.
2. 먼저 사진을 수정하세요
대부분의 유사성 문제는 프롬프트를 입력하기 전에 결정됩니다. 모델은 사진이 보여주는 것만 유지할 수 있습니다.
- 정면, 눈을 뜨고. 측면이나 시선을 돌리는 모습은 모델이 필요로 하는 특징의 절반을 가립니다.
- 균일한 조명. 창문 빛이나 그늘진 야외 빛. 강한 햇빛이나 링 라이트는 얼굴을 평평하게 만들거나 분리합니다.
- 뷰티 필터나 과도한 편집 금지. 모델은 필터가 부드럽게 만든 피부와 커진 눈을 복사할 것이므로, 결과물도 마치 필터를 사용한 것처럼 보입니다.
- 충분히 크게. 사진 높이의 최소 3분의 1을 얼굴이 차지하도록 잘라내세요. 단체 사진 속 작은 얼굴은 추측으로 확대됩니다.
- 안경은 평소에 항상 쓰는 경우에만. 만약 안경이 사람들에게 당신을 알게 하는 일부라면, 그것을 유지하고 모든 프롬프트에 언급하세요.
- 최근의 사진. 5년 전 사진은 5년 전 영상을 만들어냅니다.
두 사람이 등장하는 경우, 배경이나 옷차림이 다른 별도의 사진 두 장을 사용하세요. 거의 동일한 셀카를 여러 장 사용하는 것이 얼굴이 섞이기 시작하는 방식입니다.
3. 영상 제작 전에 한 장의 정지 이미지로 유사성을 테스트하세요
이 단계가 가장 많은 돈을 절약해 줍니다. 비디오 크레딧을 사용하기 전에, 참조 사진을 받아들이는 이미지 모델을 사용하여 따뜻한 결말 장면(두 사람이 살아있는 모습, 좋은 조명)의 단일 정지 이미지를 생성하세요.
만약 그 정지 이미지가 당신처럼 보이지 않는다면, 영상도 그렇지 않을 것입니다. 각 시도가 저렴할 때 사진이나 설명을 수정하세요. 정지 이미지가 제대로 되면, 그것이 비디오의 시작 프레임이 되며, 모델은 원본 사진보다 훨씬 나은 앵커를 갖게 됩니다.
4. 각 인물에 대한 설명을 한 번 작성하고 정확하게 재사용하세요
모델은 이름을 알지 못하므로 사용자가 묘사하는 내용에 의존합니다. 만약 한 장면에서 '어두운 곱슬머리'라고 하고 세 번째 장면에서 '갈색 웨이브 머리'라고 한다면, 당신은 두 명의 사람을 요청한 것입니다.
각 인물당 하나의 아이덴티티 블록(identity block)을 작성하고 단어를 변경하지 않은 채 모든 프롬프트에 붙여넣으세요:
Person A: woman about forty, curly dark hair streaked with grey,
shoulder length, sage-green linen shirt with rolled sleeves,
thin silver necklace, stays human.
...
그런 다음 각 샷 프롬프트를 다음과 같이 구성하세요: [아이덴티티 블록] + [이 샷에서 일어나는 일] + [조명 및 카메라]. 가운데 부분만 변경합니다.

같은 여성, 세 가지 모습. 머리, 셔츠, 목걸이는 절대 변하지 않기 때문에 돌아선 버전도 그녀로 인식됩니다. AI로 생성된 이미지.
옷을 네 장면 모두 동일하게 유지하세요. 의상 변경은 얼굴이 가장 많이 이탈하는 부분입니다. 모델은 새로운 의상을 새로운 사람을 만들 수 있는 허가로 간주하기 때문입니다. 앵커 오브젝트(anchor object) (반지, 스카프, 개의 목줄)를 하나 선택하여 모든 프롬프트에 이름을 붙여주세요. 얼굴이 약간 변하더라도 앵커는 여전히 보는 이에게 같은 사람임을 알려줍니다.
5. 장면을 짧게 유지하고 각 장면은 정지 이미지에서 시작하세요
- 각 샷을 약 4초로 만들고 편집할 때 연결하세요. 네 개의 짧은 샷이 한 번에 15초짜리 샷보다 얼굴과 더 가깝게 느껴집니다.
- 모든 좀비 샷은 **같은 정지된 차가운 이미지(cold still)**에서 시작하고, 끝은 **따뜻한 정지 이미지(warm still)**에서 마무리하세요. 텍스트만으로 비디오를 생성하지 마세요. 왜냐하면 텍스트만으로는 새로운 얼굴을 만들어내기 때문입니다.
- 각 샷에 대해 두세 번의 테이크를 만들고 가장 좋은 것을 유지하세요. 전체 비디오가 아닌 문제가 있는 샷만 다시 생성하세요.
6. 부드럽게 돌리세요
좀비가 극단할수록, 그 사람의 모습이 남아있을 확률은 적습니다.
같은 얼굴, 같은 머리, 그리고 같은 옷을 참고 자료와 동일하게 유지합니다.
창백한 회색 피부, 흐릿한 흰 눈, 다크서클,
찢어진 소매, 차분한 표정. 피나 상처는 없습니다.
이렇게 하면 대부분의 모델 콘텐츠 필터(종종 고어물이나 물림 장면을 차단함)를 통과할 수 있습니다.
7. 두 얼굴이 합쳐지는 경우
- 배경과 옷이 다른 별도의 사진을 사용하세요 (섹션 2 참조).
- 모든 샷에서 각 인물이 프레임의 어디에 있는지 명시하세요: “왼쪽에 A, 오른쪽에 B.”
- 포옹 장면은 두 사람이 이미 올바른 상태인 정지 이미지에서 만들고, 텍스트로 생성하지 마세요.
- 잘못된 사람이 돌아섰다면, 어떤 사진이 A이고 어떤 사진이 B인지 바꿔주세요. 프롬프트에서 수정하려고 하지 마세요.
8. 적절한 샷 판단하기
좀비 장면은 특징을 숨기는 것이 목적입니다. 친구들은 얼굴이 아니라 머리 모양, 옷, 그리고 기준 물체(anchor object)를 통해 당신을 알아봅니다. 얼굴이 완전히 보이는 따뜻한 결말에서 유사성을 판단하세요. 만약 결말이 올바르고 좀비 장면들이 근접하다면, 영상은 성공적입니다.
반려동물은 생각보다 쉽습니다
개와 고양이에게도 동일한 규칙이 적용되지만, 한 가지 차이가 있습니다: 그들의 **표식(markings)**이 사람의 얼굴 역할을 합니다. 눈높이에서 촬영하고, 플래시를 사용하지 마세요 (눈 색깔이 변합니다). 그리고 패치, 귀 모양, 목줄이 사진에 포함되어 있는지 확인하세요. 정체성 블록에 표식을 명시하세요: “흑갈색 바탕에 가슴 부분 흰색 무늬, 왼쪽 귀가 접혀 있고, 뼈 모양 태그가 달린 빨간 목줄.”
공개 정보: 저는 두 장의 사진으로 이 영상을 만드는 사이트 AI Zombie를 구축했습니다. 이 사이트는 정지 이미지, 네 개의 비트(beats), 그리고 컷을 자동으로 처리해주므로 위 단계의 대부분이 내부에서 이루어집니다. 유료이며 (6.90달러의 일회성 크레딧, 구독 없음), 사진은 7일 후에 삭제됩니다. 직접 하고 싶다면, 무료 사진 가이드가 섹션 2에 대해 더 깊이 다룹니다.
어떤 상황에서도 얼굴이 계속 표류하는 것 같나요? 시도해 본 것을 댓글로 남겨주시면 제가 해결책을 제안해 드릴게요.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기