
2026년 AI 쇼츠 한 편의 제작 원가: Sora 없이, 환상 없이 운영되는 컨베이어 벨트
요약
OpenAI의 Sora 서비스 종료와 Google Veo/Gemini의 가격 정책 변화에 따른 AI 영상 제작 비용 구조를 분석합니다. 단순 초당 비용보다 모델 티어 선택과 영상의 불량률, 플랫폼 규제가 실제 제작 원가에 더 큰 영향을 미칩니다.
핵심 포인트
- Sora 서비스 종료 및 API 지원 중단에 따른 시장 변화
- Google Veo/Gemini의 티어별 가격 차이가 예산 결정의 핵심
- 단순 생성 비용보다 영상 불량률과 플랫폼 수익 창출 제한이 중요
- 모델 마이그레이션 및 토큰 기반 과금 방식에 대한 이해 필요
Sora는 종료되고, 저렴한 티어의 Veo와 Gemini는 초당 $0.05–0.10 수준으로 떨어졌습니다. 이제 영상의 실제 가격을 결정하는 것은 초당 요금이 아니라, 불량률과 YouTube의 규정입니다.
2026년 4월 26일, Sora의 웹 버전과 애플리케이션 서비스가 중단되었습니다. 9월 24일, OpenAI는 sora-2, sora-2-pro 및 날짜가 지정된 세 가지 버전 등 총 다섯 가지 모델 스냅샷과 함께 Videos API를 제거할 예정이지만, 그 대체제에 대해서는 언급하지 않았습니다. 이 내용은 OpenAI의 Deprecation(지원 종료) 페이지에 명시되어 있습니다. 이러한 단계적 종료 방식은 The Decoder의 독립적인 분석을 통해서도 확인되었습니다. 오늘날 'AI 영상'을 단순한 기사 주제가 아니라 시나리오, 프레임, 음성, 자막, 게시로 이어지는 일상적인 업무로 다루는 이들에게 이는 한 가지를 의미합니다. 즉, 반년 전 Sora를 중심으로 구축된 컨베이어 벨트(pipeline)가 마지막 두 달간의 수명을 다해가고 있다는 것입니다.
이제 그 중심은 Google로 이동하고 있습니다. 저렴한 티어에서의 생성 1초당 비용은 $0.05–0.10 수준이지만, 이 기준으로 예산을 책정하는 것은 무의미합니다. 저렴한 1초가 곧 쓸만한 영상임을 보장하지 않으며, 이러한 영상들이 게시되는 플랫폼은 지난 7월부터 정형화된 컨베이어 벨트 방식의 제작을 수익 창출 제한(demonetization)의 사유로 간주하고 있기 때문입니다. 아래에서는 실제 30초짜리 영상 한 편의 가격이 어떻게 구성되는지, 그리고 왜 모델의 선택보다 불량률(defect rate)이 더 중요한지에 대해 다룹니다.
아무도 온전히 지불하지 않는 초당 가격
소리와 함께 완성된 비디오 1초당 Veo 3.1의 공식 요금은 다음과 같습니다: Lite — 720p에서 $0.05, 1080p에서 $0.08; Fast — $0.10/$0.12/$0.30 (4K 포함); Standard — 720p 및 1080p에서 $0.40, 4K에서 $0.60이며, 이는 Gemini API 가격표에 명시되어 있습니다. 720p Lite에서 720p/1080p Standard로 넘어가면 8배의 차이가 발생하며, $0.60인 4K까지 포함하면 12배의 차이가 납니다. 두 경우 모두 결론은 하나입니다. 제품군 내에서 어떤 티어(tier)를 선택하느냐가 벤더(vendor)를 선택하는 것보다 예산에 더 큰 영향을 미친다는 것입니다. 한편, 기존 엔드포인트인 veo-2.0-generate-001과 두 버전의 veo-3.0은 2026년 6월 30일에 이미 중단되었습니다. 3.1로의 마이그레이션(migration)은 필수이며, 이는 Gemini API 변경 로그(changelog)에 기록되어 있습니다.
이와 동시에 6월 30일에는 Gemini Omni Flash가 퍼블릭 프리뷰(public preview)로 출시되었습니다: 310초 길이의 클립, 대화형 결과 수정, 토큰 기반 과금 방식 — 입력 토큰 100만 개당 $1.50, 출력 토큰 100만 개당 $17.50이며, 비디오 초당 5792개의 토큰이 고정된 비율로 적용됩니다. 즉, 초당 약 $0.10로 Veo 3.1 Fast와 대등한 수준입니다. Gemini API의 개발자 관계(developer relations) 책임자인 Logan Kilpatrick는 이를 생성과 동일한 가격으로 제공되는 최첨단(state-of-the-art) 편집 기능이라고 불렀습니다 — 이 인용구는 eesel AI의 분석에 포함되어 있습니다. 독립적인 블라인드 Elo 레이팅(Elo-rating)에서 Omni Flash는 분당 $6.00에 1246점이라는 결과로 실제로 선두를 달리고 있으며, Dreamina Seedance 2.0 (1228, $9.07)과 Wan2.7 (1164, $9.00)을 앞서고 있습니다 — 데이터 출처는 Artificial Analysis입니다. 하지만 10초라는 상한선은 30초짜리 쇼츠(shorts)를 제작할 때 34개의 별도 유료 생성 작업으로 나누어야 함을 의미합니다. 또한 Omni Flash Preview에는 Gemini에서 흔히 볼 수 있는 50% 배치 할인(batch discount)이 적용되지 않으며, 프리뷰 조건상 유료 티어의 데이터가 제품 개선을 위해 Google에 의해 사용될 수 있습니다 — 이 역시 eesel AI의 분석 내용이며, 이는 대량의 야간 배치 작업(nightly runs) 시의 산술적 계산을 완전히 바꿔 놓습니다.
제대로 된 1초는 명목 가격보다 3~5배 더 비싸다
바로 이 지점에서 벤더(vendor)의 수치와 현장의 수치가 어긋납니다. DTF의 실무자이자 저자인 **빅토리아 코브댜(Viktoria Kovdya)**는 다음과 같은 사실을 기록했습니다. Kling AI에서 10번의 생성(generation)을 수행했을 때 게시 가능한 결과물은 단 23개뿐이므로, 실제 원가는 초당 명목 가격보다 35배 더 높습니다. 또한 그녀의 DTF 계산에 따르면, 서비스 간 클립 하나당 가격 편차는 $0.14에서 $13.50까지 무려 96배에 달합니다. 이 측정값은 독립적으로 재현되지 않은 단일 측정치이며, 공개된 방법론 없이 실무자가 직접 측정한 결과입니다. 하지만 바로 이 점이 그녀의 사례에서 초보자가 영상 하나당 5번의 시도를 할 때, 10개의 에피소드를 제작하는 데 $20~$90의 수익을 올리는 대신 $115를 지출하게 되는 이유를 설명해 줍니다.
Kilpatrick의 프레임워크와 코브댜의 프레임워크 사이의 차이는 'API 호출 비용이 얼마인가'와 '게시 가능한 영상 한 편의 비용이 얼마인가'의 차이입니다. 예산을 결정하는 것은 후자입니다.
30초짜리 영상에 실제로 들어가는 비용
공식은 복잡하지 않습니다: 생성 초 수 × 티어(tier)별 요금 × 시도 횟수(duplicates) + 립싱크(lipsync) + 트랜스크립트(transcript) + 자막(subtitles). 여기서 '시도 횟수'는 곧 '불량률 계수' 필드입니다. 만약 모델이 귀하의 시나리오에서 안정적으로 높은 품질의 생성물을 만들어낸다는 것을 아직 증명하지 못했다면, 이 값에 1이 아닌 3~5를 대입하십시오.
| 단계 | 요금제 | 영상 한 편당 비용 (~30–32초) | 불량률 계수 ×3–5 적용 시 |
|---|---|---|---|
| 비디오 (Omni Flash, 8초씩 4개 세그먼트) | $0.10/초 | $3.20 | $9.60–16.00 |
| ... |
스크립트 및 자막 요금은 각각 OpenAI 가격표와 Submagic 가격표를 기준으로 합니다. 립싱크 (Lipsync)의 제한 사항—정지 화면은 처리되지 않음, 측면 각도는 결과가 좋지 않음, 긴 영상은 타임아웃 위험으로 인해 30~40초 단위로 잘려야 함—은 sync.so 문서에 명시되어 있습니다. 벤더(Vendor)가 제시하는 "가공되지 않은 (raw)" 영상 한 편당 $1–5 범위 또한 다른 티어(Tier) 조합을 통해 일치함을 확인할 수 있습니다. 720p 기준 $0.05인 Veo 3.1 Lite, 하한선 기준 초당 $0.02인 립싱크 (Lipsync), 그리고 Submagic Business 플랜 + API 가격(100개 영상에 $69, 즉 개당 $0.69)을 조합하면 단 한 번의 재촬영 없이 30초당 약 $2.8가 소요됩니다. 스타터 플랜($15개 영상에 $19, 즉 영상당 $1.27)을 사용할 경우 동일한 조합의 비용은 약 $3.4로 상승합니다. 즉, 자막 요금제 선택이 첫 번째 불량 발생 전부터 전체 결과값의 약 5분의 1을 좌우합니다. 위의 표가 더 높은 비용을 계산한 이유는 Omni Flash를 $0.10로 책정하고 립싱크 (Lipsync) 비용 범위를 초당 최대 $0.133까지 고려했기 때문입니다. 불량률을 고려할 때, Kovdia의 실무 데이터는 두 시나리오 중 어느 쪽이든 실제에 더 가깝습니다.
YouTube 수익화: 관습에 대한 타격
2026년 7월 16일 업데이트된 수익화 정책은 합성 비디오 (synthetic video)를 금지하지 않습니다. 대신 YouTube 수익화 정책에 따라 '비진정성 콘텐츠 (inauthentic content)'를 세 가지 범주로 상세화했습니다: 템플릿화되고 반복적인 콘텐츠, 불쾌하고 충격적인 콘텐츠, 그리고 건강, 법률, 금융, 정치와 같은 민감한 주제를 다루는 AI 페르소나 (AI-personas)입니다. Trust and Safety 부문의 책임자인 Matt Halprin은 Creator Insider를 통해 그 목적을 명확히 설명했습니다. 플랫폼은 '많은 영상을 만드는 것' 자체를 반대하는 것이 아니라, 모든 영상이 똑같이 보이고 똑같이 들리는 것을 반대한다는 것입니다 — 이 코멘트는 TechCrunch의 기사에 인용되었습니다. '대량 생산'의 임계치는 숫자로 정의되지 않았고 법 집행 과정도 불투명하지만, 단 하나의 고정된 장면 템플릿과 하나의 목소리에만 의존하는 채널은 수익 전체를 잃을 위험이 있습니다.
실무자의 반론: 컨베이어 벨트는 구독이 아니라 부서다
여기서 이 모든 산술적 계산에 대한 강력한 반론이 제기됩니다. 초당 비용은 원가 구성 요소 중 가장 작고 가장 불안정한 부분입니다. 비즈니스를 위한 '콘텐츠 공장'을 구축하고 있는 vc.ru의 저자 Nikita Krasilov는 경쟁사들이 주당 5개의 영상을 제작할 때 자신들은 하루 15~20개의 영상을 제작하는 정기성을 목표로 삼고 있다고 밝히며 다음과 같이 덧붙였습니다: "직원 한 명으로는 도저히 감당할 수 없습니다." 그는 vc.ru의 분석에 따르면, 워크플로우는 각 단계마다 책임자가 있는 하나의 부서가 유지하며, AI는 개별 단계를 가속화할 뿐 전체 체인은 인간이 담당한다고 설명합니다. 여기에 비진정성 콘텐츠 (inauthentic content) 정책에 따른 수익 창출 중단 위험과 API 단절 — 두 달 뒤면 Sora가 나오고, veo-3.0은 이미 한 달 전부터 사장된 상태 — 을 더하면, 촬영 대비 비용 절감이 자동으로 이루어지지는 않습니다.
그리고 절감 효과는 실질적입니다. Raketa Digital의 데이터에 따르면, 프리랜서의 Reels 한 편 제작 비용은 5,00030,000 ₽이며, 프로덕션 패키지의 경우 영상 한 편당 약 12,50016,700 ₽입니다. 결함이 있는 AI 컨베이어 벨트의 상한선인 $37(달러당 90 ₽로 대략 계산 시 약 3,300 ₽)조차 이보다 한 자릿수(order of magnitude) 더 낮습니다. 이 격차는 논쟁의 여지가 없습니다. 논쟁의 여지가 있는 것은, "더 저렴하다"와 "10개 중 2~3개의 쓸만한 테이크(take)를 골라내고 플랫폼 정책을 모니터링하는 사람이 살아있는 상태에서 더 저렴하다" 사이의 차이를 누가 메우느냐 하는 점입니다.
두 가지 결제 경로와 하나의 해결되지 않은 단계
러시아의 제작자에게 실질적인 선택은 두 가지 문제에 직면합니다: 어떤 채널을 통해 결제할 것인가와 테이크(take)의 품질을 누가 책임질 것인가입니다. 여기서 "어떤 모델이 더 나은가"라는 질문은 두 번째 문제입니다. 공식 API를 통해 Veo와 Omni Flash에 직접 접근하면 티어(tier)와 프롬프트(prompt)를 완전히 제어할 수 있지만, 해외 결제용 카드가 필요하며 지속적인 디프리케이션(deprecation, 기능 폐지)을 모니터링해야 합니다. 실제로 지난 6월에 Veo의 엔드포인트(endpoint) 세 개가 중단되었습니다. KolerskyAI의 Video SD Bot과 같은 루블화 결제 봇은 결제 문제를 해결해 줍니다. 1201,000 크레딧당 129890 ₽의 패키지를 제공하며, 8초 분량의 VEO-3는 80 크레딧이 소요됩니다. 하지만 이곳은 자막 기능을 전혀 명시하지 않았으며, 결과물에 대한 권리 관계도 페이지에 공개되어 있지 않습니다. 한편, 러시아어 음성 합성(voiceover) 경로는 좁아졌습니다. SaluteSpeech 요금제에 따르면 SaluteSpeech는 2026년 7월 15일부로 개인을 위한 패키지 판매 및 프리미엄(Freemium) 모델을 종료했습니다. 또한, 이 분석 시점 기준으로 ElevenLabs의 가격 페이지가 아예 열리지 않았습니다. 즉, 음성 합성 경로는 여전히 컨베이어 벨트의 해결되지 않은 단계로 남아 있습니다.
특정 벤더보다 모델 비교와 결제의 안정성이 더 중요한 단계에서는, 일부 팀들이 하나의 OpenAI 호환 API(예: provod.ai)를 통해 시나리오 및 텍스트 레이어를 관리합니다. 즉, 기존의 OpenAI 호환 클라이언트에서 base URL과 키(key)만 교체하여 연결하면, 각 제공업체(provider)마다 별도의 통합 과정을 거칠 필요 없이 카탈로그 내의 모델들을 하나의 API에서 비교할 수 있습니다. 생산량이 Krasilov가 언급한 부서 규모에 도달하면, 문제는 '초당 가격'에서 '누가 어떤 문서로 결제하는가'의 문제로 옮겨갑니다. 러시아에서의 provod.ai 결제는 러시아 카드, SBP(Fast Payment System), 또는 계좌 이체를 통해 루블화로 이루어지며, 기업은 러시아 법인이 발행하는 계약서와 증빙 서류를 이용할 수 있습니다. 이는 회계 부서가 해외 API 접속을 위해 프로덕션 에이전시나 암호화폐 중개 업체를 거쳐야 했던 부담을 덜어주지만, 비디오 모델의 선택이나 양질의 테이크(take)를 선별하는 작업 자체를 없애주지는 않습니다.
결과물에 대한 하나의 실무 규칙은 다음과 같습니다: 기본적으로 계산기에 불량률 계수 ×3~5를 대입하고, 특정 모델이 귀하의 실제 시나리오에서 반대의 결과를 증명할 때까지 그 수치를 유지하십시오. 결과물에 벤더보다 더 큰 영향을 미치는 두 가지 설정은 구성 요소 내의—비디오 모델의 티어(Veo 3.1 Lite의 초당 $0.05부터 Standard의 $0.40까지)와 자막 플랜(영상당 $0.69 대 $1.27, 첫 번째 테이크가 나오기도 전에 전체 구성 비용의 약 5분의 1을 차지함)입니다. 일정표에는 두 가지 날짜를 염두에 두어야 합니다: OpenAI가 Videos API와 Sora 2의 5가지 스냅샷을 출시하는 2026년 9월 24일, 그리고 Omni Flash가 프리뷰(preview)에서 출시되는 시점입니다. Omni Flash의 프리뷰 조건으로는 초당 $0.10의 가격과 10초의 상한선이 명시되어 있습니다. 이 두 날짜가 다가오면 컨베이어 벨트(conveyor belt) 시스템을 다시 계산해야 하므로, 이를 생산 계획에 즉시 반영해 두는 것이 좋습니다.
provod.ai — 급변하는 AI 시장에 대한 단일 접속 지점
새롭고 수요가 높은 모델들이 최대한 빠르게 추가됩니다: 새로운 공급업체가 등장하더라도 팀이 통합 과정을 처음부터 다시 구축할 필요가 없습니다. API, 잔액, 그리고 익숙한 도구들이 그대로 유지됩니다. 특정 모델의 가용성은 실시간 카탈로그를 통해 확인할 수 있습니다.
하나의 카탈로그에 담긴 텍스트 및 미디어용 최신 모델들: OpenAI의 GPT, Anthropic의 Claude, Google의 Gemini, xAI의 Grok, DeepSeek, Qwen, GLM, Kimi 및 MiniMax; 이미지용으로는 Nano Banana 2 Pro 및 GPT Image; 비디오용으로는 Seedance, Kling, Veo 및 Google Omni의 최신 버전이 포함됩니다. 또한 추론 (reasoning), 검색 (search), 문서 (documents), 임베딩 (embeddings), 음악 및 오디오를 위한 모델들도 사용할 수 있습니다.
새로운 모델이 등장해도 provod.ai 측의 추가적인 "신규성 세금 (novelty tax)"은 없습니다: 가격은 제공업체의 공식 요율과 1:1로 일치합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기
