【연재 1회】 세 가지 영상 생성 AI에 같은 이미지를 제공했더니, 전부 같은 곳이 망가졌다
요약
본 글은 AI 영상 생성 모델 세 가지를 사용하여 친칠라가 얼굴을 씻는 영상을 제작한 경험을 공유합니다. 동일한 시작 이미지와 지시문을 사용했음에도 불구하고, 모든 모델에서 앞발 부분에 일관된 오류(손가락 형태의 변형)가 발생했습니다. 이는 모델 자체의 성능 문제보다는 소재 선정 및 프롬프트 설계 방식에 대한 분석적 접근이 필요함을 시사합니다.
핵심 포인트
- AI 영상 생성은 단순히 모델 비교를 넘어선 소재 선정과 디테일한 조건 설정이 중요함.
- 여러 상용 모델에서 동일한 오류가 발생했다는 것은 공통적인 기술적 한계점을 보여줌.
- 영상 제작 시, 조회수 중앙값 등을 활용하여 성공 가능성이 높은 주제를 과학적으로 선택해야 함.
- 비싼 모델이라도 특정 항목(중앙 유지)에서 실패할 수 있으며, 저렴한 모델과 오류 패턴이 일치하는 경우가 있음.
친칠라가 얼굴을 씻는 8초짜리 영상을 세 가지 모델로 동일한 조건으로 만들게 했다. 세 개 모두 불합격이었다. 게다가 망가진 장소가 같았다.
원인은 모델의 성능이 아니라, 소재를 고른 방식이었다. 분리하는 과정과 그때 측정했던 수치를 적는다.
이 글은 AI로 동물 영상을 만들려고 하는 사람들을 위한 것이다. 사용한 것은 fal.ai 경유의 3개 모델이었고, 총 비용은 $1.12(약 170엔)가 들었다.

세 모델 공통으로 제공한 시작 이미지. Codex로 생성한 1672×941 크기의 친칠라.
왜 동물인가
YouTube의 동물 영상 1,279개를 세어보니, 장면에 따라 조회수가 자릿수 차이가 났다.
| 장면 | 건수 | 조회수 중앙값 |
|---|---|---|
| 물을 마시거나 물과 놀기 | 23 | 5,281만 |
| ... | ||
| 평균이 아니라 중앙값을 보고 있다. 한 번의 대박에 끌려가지 않도록 하기 위해서다. |
이 표를 보고 '털 손질'을 골랐다. 516만이면 충분하고 움직임이 파악하기 쉽다. 이것이 나중에 효과가 있었다.
조건을 맞추어 세 모델에 같은 것을 제공했다
바꾼 것은 모델뿐이었다.
- 시작 이미지: 동일한 한 장 (1672×941)
- 지시문: '앞발로 얼굴을 씻는 털 손질을 계속한다. 카메라는 완전히 고정'
- 길이: 8초, 소리 없음
- 판정: Codex에 5개 항목(카메라 고정・중앙 유지・움직임의 자연스러움・형태의 일관성・화질)을 보여주기
| 모델 | 출력 | 단가 |
|---|---|---|
| minimax/h3-max-turbo 768P | 1344×768 24fps | $0.01/초 (당시 프로모션 가격) |
| ... |
세 개 모두 떨어졌다. 판정은 5개 항목 중 3개 항목이 모든 모델 공통으로 불합격
| 모델 | 카메라 고정 | 중앙 유지 | 움직임의 자연스러움 | 형태의 일관성 | 화질 |
|---|---|---|---|---|---|
| h3-max-turbo | 통과 | 통과 | 실패 | 실패 | 실패 |
| ... | |||||
| 4초 시점을 나열하면 이렇게 된다. |

자세가 세 모델 모두 다르다. 같은 이미지에서 시작했고, 같은 지시문을 제공했다.
망가진 것은 앞발이었다. 확대한다.

왼쪽(h3-max-turbo)은 앞발이 가슴에 녹아져 손가락 모양이 남아있지 않다. 중앙(veo3.1-lite)은 윤곽이 사라져서, 앞발인지 털 덩어리인지 판별할 수 없다. 오른쪽(wan-3.0)만 손가락 모양이 보이지만, 좌우 손의 형태가 다르다.
Codex는 세 모델 모두 같은 취지의 수정 방법을 제시했다. 손가락 개수를 유지하는 것, 손가락을 융합시키지 않는 것, 동작량을 작게 하는 것. 세 개의 다른 모델에 대해 동일한 지적이 나오고 있다.
가장 비싼 모델이 가장 나빴다
wan-3.0은 $0.10/초로 세 개 중 가장 비쌌다. 그 한 모델만이 '중앙 유지'를 실패했다. 게다가 도중에 얼굴이 다른 개체처럼 변하고, 6초에 털 손질을 멈추고 바닥으로 내려왔다.
싼 쪽 두 개($0.01/초와 $0.03/초)는 판정 항목의 내역이 일치했다. 같은 곳에서 통과하고, 같은 곳에서 실패하고 있다.
단가가 3배에서 10배 차이가 나도 결과가 그렇게 나오지는 않았다.
여기서 멈췄다. 모델이 약한 것인지, 소재가 어려운 건지
세 개 모두 떨어졌기 때문에, 모델 간의 차이가 나오지 않는다.
앞발이 망가지는 것이 모델의 한계일까. 아니면 '앞발이 주역인 소재'를 고른 우리의 문제일까. 이 두 가지를 분리하지 않은 채 다음 모델을 시도해도, 같은 결과만 나올 뿐이라고 판단했다.
분리하는 방법은 간단하다. 앞발을 화면에서 지우면 된다.
앞발을 숨기자, 파탄이 사라졌다
두 번째는 시작 이미지를 바꿨다. 앞발을 몸 아래에 숨긴 정면 얼굴로 하고, 지시문도 '수염이 살짝 움직이고, 코가 씰룩거리고, 눈 깜빡임 1~2회'로 낮췄다. 모델은 h3-max-turbo와 veo3.1-lite의 두 개였다. wan-3.0은 1회차에서 최하위였기 때문에 제외했다.

Codex 판정에는 '앞발의 갑작스러운 출현은 없다'고 명시되었다. 얼굴과 몸통의 대략적인 틀도 유지되었다. 1회차에 발생했던 융합도 변형도 소실도, 하나도 나오지 않았다.
앞발의 파탄은 소재 탓이었다.
남은 것은, 현행 모델 공통의 약점이었다
2회차에서 사라지지 않은 것이 두 가지 있다. 수염의 개수・길이・뿌리와, 이마와 볼의 줄무늬. 둘 다 가는 선이며, 시간이 지남에 따라 깜빡거린다.
이것은 2개 모델 공통으로 나타났고, Codex가 제시한 수정 방법도 거의 같은 내용이었다. 모델 실력 차이가 아니라, 지금의 모델들이 공통적으로 어려워하는 부분이라고 본다.
모델별 차이로 나온 것은 여기이다.
動きの制御は veo3.1-lite が上で、構図の固定は h3-max-turbo が上だった。どちらが優れているという話にはならなかった。
파악한 점과 다음 할 일
주제의 난이도를 가리지 않고 모델을 비교하면 아무것도 알 수 없다. 1회차 때 한 것이 그것이었다.
동물 장면에는 모델의 성능과는 별개로, 부서지기 쉬운 순위가 있다. 앞발이 주역인 장면은 가장 부서지기 쉬운 부류에 속한다. 재생수 표를 보고 '털 손질(毛づくろい)은 516만'이라고 판단했을 때, 이 축을 가지고 있지 않았다.
지금 사용하고 있는 장면의 표에는 재생수 열 옆에 '부서지기 쉬움' 열을 추가해 두었다. 털 손질은 최고 난도로 기록했다. 잠든 얼굴(寝顔)은 움직임이 최소라서 가장 부서지기 어렵다.
오늘 할 수 있는 가장 작은 한 걸음을 하나 꼽자면, 모델을 비교하기 전에, 부서지기 쉬운 부위가 나오지 않는 주제로 한 번 만들어 보는 것이다. 거기서 망가지면 모델의 문제이고, 망가지지 않으면 주제의 문제다. $0.24(약 36엔)으로 가려낼 수 있다.
보충: 청구액은 현장 표시와 달랐습니다
1회차 실비는 잔고 차이로 $0.32라고 읽었다. 견적의 $1.12보다 훨씬 적었기 때문에, 그때는 저렴하게 끝났다고 판단했다.
나중에 다시 확인해 보니, 늦게 인출된 것일 뿐 실제로 견적대로 $1.12였다. 3회차 생성에서도 잔고 차이 $1.752가 견적과 일치한다.
생성 직후의 잔고 표시는 그 시점의 청구를 반영하지 않는다. 이 이야기는 비용 편에서 자세히 쓰겠다.
이 기사는 연재의 1회차다. 다음 회차에는, 이 판정 자체에 결함이 있었다는 이야기를 쓸 것이다. Codex에게 2초 간격의 정지 이미지 5장을 보여주고 판정하게 했었는데, 그 측정 방식으로는 움직이는 것이 당연한 부위가 전부 '파탄(破綻)'으로 감지된다. 3회분 판정 결과를 나중에 모두 의심하게 되었다.
Discussion

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기