
Veo Lite vs Seedance 2.0 vs Gemini Omni — 동영상 생성 API 3종 비교를 통한 프로그램 아바타 재제작 실록
요약
동영상 생성 API 3종(Veo Lite, Seedance 2.0, Gemini Omni)을 활용하여 프로그램 아바타를 재제작한 실측 비교 기록입니다. 각 모델의 비용, 원본 이미지 충실도, 편집 가능성 및 루프 생성 기술을 분석합니다.
핵심 포인트
- Veo 3.1 Lite는 저렴하지만 원본 구도가 재해석되는 경향이 있음
- Seedance 2.0은 원본 충실도가 매우 높으며 종단 프레임 지정으로 완벽한 루프 구현 가능
- Gemini Omni Flash는 Interactions API를 통해 대화형 동영상 편집 지원
- API 사용 시 초당 과금 여부 등 단위를 반드시 확인해야 함
서론
매일 아침 AI가 뉴스 프로그램을 제작하여 YouTube에 업로드하는 파이프라인(지난번에는 AI 디렉터에 관한 이야기)을 운영하고 있습니다. 이번에는 해당 프로그램의 아바타(Veo로 생성한 모션 루프)를 최신 동영상 생성 API 3개를 실제로 측정 및 비교하여 재제작한 기록입니다.
계기는 매주 진행하는 "기술 스카우트"— AI 에이전트가 WebSearch를 통해 동영상 자동화의 신기술 및 가격 개정을 조사하고, 파이프라인의 기존 문제점과 대조하여 제안하는 시스템입니다. 그 첫 번째 리포트에서 "Veo 3.1 Lite가 나왔다, 저렴하다", "MuseTalk로 립싱크(Lip-sync) 재도전이 가능하다"라는 내용이 보고되었고, 그 결과 당초 리스트에 없던 모델이 실제 서비스에 채택되었습니다. 기술 선정 과정에서 흔히 발생하는 일입니다.
실측한 4개 모델과 결과 요약
동일한 소재와 동일한 프롬프트로 실제로 생성하여 비교했습니다. 가격은 모두 실측 기반입니다.
| 모델 | 8초 720p 실비용 | 강점 | 약점 |
|---|---|---|---|
| Veo 3.1 Lite | $0.40 | 최저가·기존 Gemini API 키로 작동 | 원본 이미지를 "재해석"함 (구도가 바뀜) |
| Seedance 2.0 (standard) | $2.42 | 원본 이미지에 대한 충실도가 압도적·종단 프레임 지정으로 완전 루프 | 높음 (당초 $0.40로 예상했으나 6배 차이 나는 사고 발생) |
| Gemini Omni Flash | $0.80〜0.90 | 대화로 동영상을 편집할 수 있는 유일한 존재 | 캐릭터의 세부 사항이 드리프트(Drift)함 |
| MuseTalk (fal.ai) | ~ $0.2/개 | 정지 이미지 1장 + 음성으로 립싱크·일본어 대응 | 결과를 보고 "입은 움직이지 않아도 되겠다"라고 판단함 |
각각 어떤 일이 일어났는가
Veo 3.1 Lite — 저렴하지만 "다른 방"이 된다
image-to-video 방식으로, 승인된 정지 이미지(빈 회의실에 8개의 의자)를 동영상화했습니다. 생성 45초·음성 포함·$0.40는 불만이 없습니다. 하지만 결과물로 나온 영상은 같은 모티프를 가진 다른 방이었습니다. 의자, 아침 햇살, 노트북이라는 모티프는 유지되지만 구도가 재해석됩니다. "승인한 그림이 그대로 움직이는 것"을 기대한다면 실망할 수 있습니다. 분위기 컷을 대량 생산한다면 가장 유력한 후보입니다.
Seedance 2.0 — 충실함은 진짜, 가격 오독도 진짜
동일한 이미지와 동일한 프롬프트로 비교한 결과, 원본 이미지가 거의 완벽하게 유지된 채 달리 인(Dolly-in) 효과만 추가되는 결과가 나왔습니다. 컵의 위치까지 일치했는데, 이는 용도에 따라 결정적인 차이가 됩니다.
또 다른 발견은 end_image_url (종단 프레임 지정)입니다.
시작 이미지와 종단 이미지를 동일하게 지정하면, 루프 영상의 숙명이었던 "종단이 시작으로 돌아가지 않는 문제"를 구조적으로 해결할 수 있습니다. 실측 결과 시작/종단 프레임의 평균 픽셀 차이를 1.7(255 중)까지 줄일 수 있었습니다.
그리고 실패담: fal.ai의 가격 표기를 잘못 읽어 "$0.3/개"라고 생각했는데 "$0.3/초"였습니다. 3개를 실험하며 $7.5를 날리고 나서야 깨달았습니다. 종량제 API는 단위를 두 번 확인합시다.
Gemini Omni Flash — "대화로 편집"은 진짜, 다만 캐릭터는 흔들린다
2026년 3월에 출시된 신규 모델로, 새로 설치된 Interactions API를 통해 사용합니다 (기존의 generateContent로 호출하면 "This model only supports Interactions API"라는 오류가 발생합니다). 특징은 생성된 동영상에 자연어로 추가 지시를 덧붙일 수 있다는 점입니다. 실험에서는 Seedance로 만든 아바타의 idle 영상을 전달하고 "중간에 손을 흔들게 해줘"라고 지시했더니, 제대로 손을 흔드는 편집된 영상이 돌아왔습니다.
다만 캐릭터의 세부 사항은 드리프트합니다. 실험에서는 안대에 헤드셋 스타일의 부품이 생기거나, 슈트의 발광 라인 배치가 바뀌는 등의 현상이 있었습니다.
가격은 토큰 과금 방식으로, 720p 영상은 5,792토큰/초 $\rightarrow$ 실효 $0.10/초입니다. 입력 비용을 포함하면 8초에 약 $0.9 정도입니다.
MuseTalk — 기술은 합격, 채택은 보류
정지 이미지 1장 + TTS 음성 6.5초로 립싱크 영상을 생성했습니다 (fal.ai에서 GPU를 초 단위로 대여). 얼굴의 동일성은 유지되었고 일본어 음성에서도 잘 작동했습니다. 하지만 실제 결과물을 보고 내린 결론은 "생각보다 립싱크가 없어도 괜찮겠다"였습니다. $0.2를 들여 "하지 않겠다"라는 판단을 확정한 것은 저렴한 비용이었습니다. 실험의 가치는 실행할 이유를 찾는 것뿐만 아니라, 하지 않을 이유를 확정 짓는 데에도 있습니다.
최종 채택: 아바타 쇄신은 Omni로
최종적으로 프로그램 아바타(6가지 상태의 모션 루프)의 재제작에는 Omni를 선택했습니다. 이유는 소거법과 궁합 때문입니다.
수년간의 과제였던 '손 잘림'의 진정한 원인은 영상의 크롭 (crop)이 아니라 원본 이미지였다. 캐릭터 일러스트 자체가 팔 중간에서 잘린 소재였으며, 이는 이미지 편집 모델 (gemini-3.1-flash-image)의 아웃페인팅 (outpainting)으로 손까지 그려 넣어 해결했습니다. Seedance의 충실도는 매력적이지만, 아바타의 모든 상태를 만들면 $2.42 × 6 = $14.5가 소요됩니다. Omni라면 $0.5 × 4 = $2입니다. Omni의 약점(루프 연결 부위가 거침 · 평균 화소 차이 10.8)은, 기존 파이프라인의 팔린드롬 (palindrome) 처리(전반 4초를 순방향 → 역재생)가 그대로 흡수해 줍니다. — 신기술의 약점이 기존 설계로 무효화되는 조합이었습니다.
쇄신 후에는 모든 상태의 프레임을 스캔하여 비녹색 영역(캐릭터 + 손의 가동 범위)을 실측하고, 크롭 (crop) 값과 슬라이드 측의 텍스트 회피 마진을 업데이트하여 완료했습니다. 이제 손은 더 이상 잘리지 않습니다.
요약 — 세 역할 분담이라는 결론
승자를 하나 결정하는 문제가 아니라, 역할 분담으로 결론이 났습니다.
충실도가 생명 (승인된 이미지의 영상화 · 캐릭터 일관성) → Seedance 2.0. 비용이 높으므로 소수 정예로 운용.
만든 것을 수정하고 싶을 때 (재제작이 아닌 수정) → Omni Flash. Interactions API의 멀티턴 (multi-turn) 편집은 타의 추종을 불허함.
분위기 컷의 양산 → Veo 3.1 Lite. 최저가 · 기존 키 (key).
덤으로 얻은 교훈:
- 종량제 가격 표기는 단위 (per second / per run)를 두 번 확인할 것.
- 신모델의 약점은 기존 파이프라인의 설계가 흡수할 수 있는 경우가 있다 (Omni의 연결 부위 × 팔린드롬).
- '하지 않음'을 $0.2로 확정할 수 있다면 실험 비용은 저렴하다 (MuseTalk).
- WSL2 사용자들에게: Google 계열과 fal.ai 모두 API가 IPv6로 인해 무한 행 (hang) 상태에 빠질 수 있다. IPv4 우선 패치를 항상 준비해 두어야 한다.
기술 스카우트(주 1회 자동 조사 → 제안) 메커니즘 자체도 에이전트 (agent)로 돌리고 있습니다. 그 이야기는 또 다른 기사에서 다루겠습니다.
Discussion

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기