같은 AI 영상 광고를 9가지 방식으로 만들어 보기
요약
글쓴이는 동일한 AI 영상 광고를 아홉 가지 방식으로 제작하며, AI 비디오 생성의 다양한 방법론과 비용 효율성을 비교 분석했습니다. 모델 자체보다 원본 자료와 결과물을 얼마나 주의 깊게 검토하는지가 중요함을 강조합니다. 소규모 사업체도 적은 비용으로 고품질의 광고 영상을 만들 수 있음을 보여줍니다.
핵심 포인트
- AI 비디오 제작 시, 모델 성능보다 원본 데이터 및 결과물 검토가 핵심입니다.
- 소액의 비용으로도 충분히 전문적인 AI 영상 광고 제작이 가능합니다.
- 다양한 방식(코드 기반, 로컬 무료 모델, 유료 모델 등)을 비교 분석했습니다.
원래 NuWay Biz Solutions 블로그에 게시됨.
✦ 커버 이미지: OpenArt를 통해 Kling 3.0으로 제작 (유료, 표준 720p 모드) + SeedVR2 + FLUX.1 schnell (로컬) — 우리는 AI에 대해 투명합니다. 원문에서 정확한 프롬프트 보기.
탄산음료 캔을 반쯤 열던 중, 원숭이가 허공에서 두 번째 탭을 뽑아냈습니다.
Google의 Veo 3.1에게 정확히 "탭이 붙어 있도록" 요청했고, 그 결과는 탭이 붙어 있는 모습과 비상 상황에 대비한 여분의 탭까지었습니다. 이 장면을 만드는 데 비용은 34센트였습니다.
저는 10월 사흘 동안 동일한 탄산음료 광고를 아홉 가지 방식으로 만들었습니다. AI를 전혀 사용하지 않은 방식, 로컬 데스크톱의 무료 모델 방식, 유료 모델 두 가지 방식, 그리고 혼합 방식이었습니다.
제가 배운 것들의 요약본은 어떤 모델을 구매해야 하는지와는 아무 관련이 없습니다. 소규모 사업체도 아주 적은 비용으로 사용할 수 있는 AI 비디오 광고를 만들 수 있으며, 중요한 것은 모델 자체보다 그 모델에 입력하는 원본 자료와 결과물을 얼마나 주의 깊게 확인하느냐입니다. 그리고 NG 장면들은 저를 크게 웃게 만들었습니다.

▶ 캔 개봉 테스트. 각 버전의 캔 개봉 장면(3D 방식은 생략)을 제작 순서대로 모았습니다. (사운드 켜기). 원문에서 시청하기
| # | 버전 | 제작 비용 | 문제가 된 부분 |
|---|---|---|---|
| 1 | 순수 코드, AI 모델 없음 | $0 | 로봇 같은 "아-" 소리 |
| ... | |||
| *저희 도구는 모드를 전송하지 않았기 때문에 OpenArt의 기본 설정이 적용되었습니다. 오늘날 그 기본 설정은 Lite이며, OpenArt는 클립별 모드 기록을 유지하지 않으므로 Lite가 최선의 추론 방식입니다. |
원숭이가 캔을 열도록 만든 이유는 무엇일까요?
선글라스를 쓴 원숭이가 탄산음료 캔을 마시는 짧은 5초 분량의 클립… 마케팅용 광고… 입맛을 다시며 '아-' 소리를 내며 캔을 즐기는 모습.
— 제 브리프, 2026년 10월 4일 (발췌)
사이다 음료인 BANANA BOOM은 존재하지 않아서 아쉽지만, 저는 바나나 사이다를 마셔보고 싶습니다. 이 기획(brief) 자체는 간단해 보이지만, 5초 안에 네 가지 요소가 포함되어 있었고, 그 요소들은 정확히 문제가 발생한 지점이었습니다: 손, 작은 메커니즘, 흘러야 할 액체, 그리고 정확한 프레임에 떨어져야 하는 균열이 그것입니다.
작업을 수행한 AI는 Anthropic의 코딩 에이전트인 Claude Code였습니다. 이 에이전트는 스크립트를 작성하고, 모든 모델을 실행하며, 편집본을 자르고 사운드를 믹싱했으며, 별도의 Claude 에이전트들이 각 결과물을 검토했습니다. 저는 기획(brief)을 작성했고, 모든 커팅본을 확인하며 어떤 부분이 최종적으로 사용될지 결정했습니다. 만약 Claude가 잘못된 것을 만들었다면, 제가 그 이름을 언급하여 지적할 것입니다.
레벨 0: AI를 전혀 사용하지 않음
원숭이 #1은 Remotion으로 코딩되어 그려졌고, 모든 사운드는 처음부터 합성되었습니다. 제작에 12분이 걸렸고, 렌더링에는 38초가 걸렸으며 비용은 $0였습니다. "아-" 소리는 로봇 같았는데, 수학이 만족한 영장류의 소리를 대체하기엔 부족했기 때문입니다.

▶ #1: AI를 전혀 사용하지 않음. Remotion으로 코딩되어 그려졌고, 모든 사운드는 합성되었습니다. $0. 5초 분량입니다. (사운드 켜기.) 원문 기사에서 시청하기.
로고 스팅(logo sting)이나 매번 동일하게 보여야 하는 마스코트의 경우, 코딩이 여전히 승리합니다: 브랜드 이름은 절대 오타를 내지 않기 때문입니다.
레벨 1: 무료이며 제 데스크톱에서 작동하는 3D 카툰
첫 번째 실제 AI 버전은 전적으로 저의 개인 데스크톱에서 실행되었으며, 상업적 사용을 위해 라이선스가 부여된 두 개의 무료 모델이 이미지 작업을 담당했습니다.
| 파트 | 사용한 것 | 역할 | 비용 |
|---|---|---|---|
| 컴퓨터 | 제 데스크톱 PC (NVIDIA RTX 3080 그래픽 카드, 10 GB; Ryzen 9 5900X; 64 GB RAM) | 모든 것을 로컬에서 실행 | 이미 소유함 |
| ... |
그러자 원숭이가 사이다를 마셨고, 사이다는 그의 가슴을 타고 흘러내렸습니다.
그래서 다음 테이크의 프롬프트에는 "흘리거나 떨어뜨리지 말 것"이라는 내용이 수많은 단어로 들어갔습니다.
하지만 여전히 흘렀습니다.
클로드(Claude)는 그 틈을 메울 짧은 클립 네 개를 요청했고, 각 클립에는 '완전히 건조하게: 액체 없음, 떨어지는 것 없음, 흘리는 것 없음'이라는 지시가 담겼다. 하지만 네 개의 클립 모두 무언가를 흘렸다. 원숭이가 전혀 등장하지 않은 제품 샷에서 탄산음료가 아직 닫힌 캔 위로 부어졌다. 유일하게 건조했던 장면은 그가 마시지 않는 장면이었다.
두 잔의 음료, 네 개의 연결 클립, 여섯 번의 누수(leak). 이렇게 지침을 무시하는 것을 이렇게까지 진심으로 한 경우는 본 적이 없다.
그래도 우리는 누수 부분을 잘라내어 영상을 완성했다. AI 비디오 편집 작업의 상당 부분은 정확히 이와 같다: 사용 가능한 프레임을 구출해내는 것이다.

▶ #2: 3D 만화, 무료, 내 데스크톱에서. FLUX.1 schnell + Wan 2.2, 음성은 Chatterbox가 담당했고, 모두 내 데스크톱에서 작업했다. 모델 비용 $0. 9.8초. (소리 켜기) 원문 기사에서 시청하기
실수 모음(Bloopers reel)은 프로젝트 전체에서 잘못된 점 아홉 가지를 각각 하나의 클립으로 수집했다.

▶ 실수 모음: 무엇이 잘못되었나. 흘린 것들, 떨어진 액체들, 만들어낸 캔, 사람의 손, 원숭이 세 마리, 두 번째 탭, 닫힌 캔, 연기 손, 그리고 클링(Kling)의 음악적 톤. (소리 켜기) 원문 기사에서 시청하기
레벨 2: 포토리얼, 여전히 무료
다음으로 시나리오가 포토리얼(photoreal)로 바뀌면서 스토리를 얻었고, 원숭이가 먼저 캔을 발견하는 것으로 시작하여 모든 것이 더 길게 진행되었다. 길이도 18초에서 27초로 늘어났다.
3, 첫 번째 포토리얼 커트는 한 광고에 세 명의 다른 원숭이를 등장시켰다: 검은색 모자와 복숭아빛 얼굴을 가진 원숭이, 거친 갈색 털을 가진 원숭이, 그리고 슬레이트 블루 색 얼굴과 흰 목깃을 가진 원숭이다. 캔을 여는 손은 손가락 없는 장갑으로 녹아내렸다.
비어있는 정글 샷에서 Claude의 프롬프트는 여전히 캔을 언급했기 때문에, Wan은 마치 프롬프트에 대한 기념비처럼 숲속에 거대하고 철자가 틀린 캔을 만들었다. 그리고 원숭이가 없는 다른 테이크에서는 인간의 손이 뻗어 나와 그 캔을 가져갔다. 세트장에서 촬영하던 다른 누군가도 탄산음료를 원했다...
이 수정은 비디오 모델 자체에는 영향을 주지 않았다. Claude는 모든 샷에서 손을 포함한 동일한 원숭이를 묘사하도록 시작 이미지를 다시 작성했고, 세 종이 하나가 되었다.
#7의 경우, 무료 이미지 편집 모델인 Qwen-Image-Edit을 사용하여 원숭이의 모든 사진을 하나의 참조 이미지로 만들었다. Wan은 각 샷을 480p로 초안 작성했고, 무료 업스케일러인 SeedVR2를 이용해 이를 1080p로 확대했다.
모든 샷에서 동일한 원숭이, 지렛대처럼 탭을 들어 올리는 손가락, 크게 내지르는 "아!" 그의 손은 고무장갑 같았지만, 모델 비용은 여전히 $0였다.
교훈 1: 시작 이미지가 비디오 모델보다 더 많은 것을 결정한다.

▶ #7: 포토리얼(photoreal), 무료 v4. 고정된 아이덴티티 + 480p의 Wan 2.2 + 1080p 업스케일, 내 데스크톱에서. 모델 비용 $0. 23.5초. 원본 기사에서 시청하기.
레벨 3: 유료 AI 비디오 $6로는 무엇을 얻을 수 있을까?
두 유료 모델 모두 여러 모델의 크레딧을 재판매하는 사이트인 OpenArt를 통해 사용되었다. 이 곳의 Plus 플랜은 12,000 크레딧에 월 $34이다. Claude는 두 모델 모두에게 동일한 시작 이미지와 프롬프트를 제공했지만, 설정은 같지 않았다: Veo는 4초 분량의 샷에서 1080p로 실행되었고, Kling은 표준 720p 모드에서 5초 분량의 샷으로 실행되었다.
Veo 3.1 (Google 제공)은 샷당 $0.34, 7개에 $2.38이 들었다. 이 모델은 여분의 탭을 만들고 "아!" 하는 동작을 소리 없이 연기했다: 입을 벌리고, 입술을 핥고, 침묵.
한 가지 유의할 점은, Veo가 OpenArt의 세 가지 Veo 3.1 설정 중 가장 낮은 'Lite' 모드로 실행되었을 가능성이 높다는 것입니다 (첫 번째 표 아래 참고). 따라서 이것이 Veo의 최고의 성능을 보여준 것은 아닐 수 있습니다.
Kling 3.0(Kuaishou 제작)은 샷당 약 $0.50, 7개는 $3.47입니다. 손가락이 캔 고리에 걸리고, 탭이 올라가고, 위에서 분사되고, 그 위에 정확히 균열이 생깁니다.
단연코 최고의 캔 개봉 시퀀스와 사운드입니다.
— Kling의 캔 개봉에 대한 나의 메모
그러자 원숭이의 손바닥이 마젠타색으로 변하며, 캔의 색깔이 그의 손으로 번집니다. 분명 페인트가 아직 젖어 있었던 모양입니다.
그들이 공통적으로 가진 두 가지 결함이 있었습니다.
원숭이는 샷마다 털 색깔을 바꿉니다 (한 샷에서는 제트 블랙, 다른 샷에서는 작고 갈색인 유아 원숭이, 또 다른 샷에서는 크림색 갈기를 가짐). 그리고 캔 개봉 샷은 평평하고 인간 같은 손톱을 가진 회색 손입니다. 둘 다 이미 시작 이미지에 포함되어 있었으며, 두 모델 모두 주어진 것을 충실하게 애니메이션화했습니다. 유료 서비스 측면에서 또 하나의 교훈이었습니다.

_▶ 9가지 버전을 한 번에. 9가지 버전 모두 원숭이의
수상한 사운드는 우리가 직접 만든 것이었습니다: 모든 효과를 측정된 프레임에 배치했죠. 저희만의 '아-' 소리는 무료 음성 모델인 Chatterbox에서 나왔고, 한 심사위원이 그 피치를 측정했습니다. 작은 원숭이에게서 나오는 성인 남성의 목소리였죠.
그래서 열 번째 단계로, 정글과 새 소리, 그리고 '아-' 소리를 위해 Sonniss의 무료 사운드 라이브러리의 실제 녹음본으로 교체했습니다. 훨씬 더 믿을 만했지만, 여전히 작은 원숭이에게는 너무 낮았고, 이제 마지막 가짜 소리들을 들을 수 있었습니다: 원숭이가 캔을 잡을 때 합성된 금속 '딸깍' 소리가 두 번 나죠. 알루미늄 캔에 손바닥을 대도 종처럼 울리지 않습니다.
레벨 4: 우승작은 하이브리드였다
남아있는 결함에도 불구하고 제가 가장 지지하는 버전은 #9입니다. 무료인 #7에서 클링(Kling)의 캔 따는 소리, '딱' 소리와 '치익' 소리를 하나 교체한 버전이죠. 유료 부분은 5초짜리 장면 한 개로, 약 50센트 정도 합니다. 제가 이 영상을 보며 적었던 메모는
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기