
30초 무편집 영상 - ByteDance의 새로운 AI 비디오 생성기 Seedance
요약
ByteDance가 최대 30초 분량의 일관된 영상을 한 번에 생성하는 AI 비디오 생성기 Seedance 2.5를 공개했습니다. 50개의 멀티모달 레퍼런스를 활용하여 편집 없이 고품질 영상을 제작할 수 있는 것이 특징입니다.
핵심 포인트
- 최대 30초 분량의 영상을 끊김 없이 단일 프로세스로 생성 가능
- 기존 12개에서 50개로 확장된 멀티모달 소스 힌트 지원
- Google Veo, Kling과 경쟁하는 최신 비디오 생성 모델
- 마케터, 인디 작가, 개발자 등 다양한 활용 가능성 제시
요약: 2026년 6월 23일 베이징에서 열린 Volcano Engine FORCE 컨퍼런스에서 ByteDance는 Seedance 2.5를 공개했습니다. 이는 50개의 멀티모달 (multimodal) 레퍼런스를 사용하여 편집(cut) 없이 한 번의 과정(one pass)으로 일관된 30초 분량의 영상을 생성하는 AI 비디오 생성기입니다. 이는 OpenAI가 Sora를 종료한 지 불과 두 달 만에 이루어진 일입니다. 아래에서는 무엇이 사실이고 무엇이 벤더의 마케팅인지, 이 신제품이 Veo 3.1 및 Kling과 어떻게 다른지, 비용은 얼마인지, 그리고 러시아에서 어떻게 접근할 수 있는지에 대해 다룹니다. 데이터는 2026년 7월 10일 기준으로 유효합니다.
provod.ai는 러시아 사용자를 위한 신경망 (neural network) 애그리게이터입니다. Claude, GPT, Gemini, DeepSeek 및 Qwen을 하나의 채팅과 단일 API (OpenAI 및 Anthropic 호환)를 통해 제공하며, VPN이나 해외 카드 없이 루블화로 합법적인 결제가 가능하고 법인을 위한 계약서 및 증빙 서류를 제공합니다. Seedance 자체와는 아직 관련이 없지만, 이 글에 등장하는 모든 주인공에 대해 러시아에서의 진입 장벽은 동일하며, 이에 대해서는 아래에서 별도로 다룹니다.
ByteDance가 공개한 AI 비디오 생성기는 무엇인가?
요약: Seedance 2.5는 ByteDance(TikTok의 소유 기업)의 text-to-video AI 생성기로, 텍스트, 이미지 및 기타 레퍼런스를 통해 비디오를 제작합니다. 버전 2.0 대비 주요 도약은 영상이 5~10초 단위의 조각들로 이어 붙여지는 것이 아니라 최대 30초까지 통째로 생성된다는 점이며, 모델이 기존 12개였던 소스 힌트(source hints) 대신 최대 50개의 소스를 기억한다는 점입니다.
만약 이전에 신경망을 이용한 비디오 생성에 접해보지 않았다면, 다음과 같은 프레임워크가 있습니다. 프롬프트(prompt)를 입력하면(“밤의 도시를 걷는 소녀, 네온, 비”) 결과물로 완성된 비디오를 얻을 수 있는 도구 클래스가 있습니다. 이것이 바로 AI 비디오 생성기입니다. 2026년 중반 시장의 플래그십 모델은 Google Veo, 중국 Kuaishou의 Kling, 그리고 ByteDance의 Seedance 라인업입니다. Seedance 2.5는 이 경쟁에서 가장 최신의 도전장입니다.
이것이 실제로 누구에게 필요한가요? 마케터와 SMM(소셜 미디어 마케팅) 담당자에게는 촬영 팀이나 제작 예산 없이 광고 영상이나 스토리를 제작하는 용도로 쓰입니다. 인디 작가에게는 애니메이션 오프닝, 뮤직비디오, 또는 단편 영화를 혼자서 만드는 용도입니다. 개발자에게는 API를 통해 자신의 서비스에 비디오 생성을 통합하는 용도입니다. 일반 사용자에게는 사진에 생동감을 불어넣거나, 축하 영상 또는 밈 (Meme)을 만드는 용도입니다.
비디오를 위한 신경망 (Neural Networks)에 대한 수요가 증가한 이유는 바로 진입 장벽이 무너졌기 때문입니다. 이전에는 스튜디오에 비용을 지불해야 했던 일들이 이제는 텍스트 프롬프트 (Text Prompt) 하나로 몇 분 만에 이루어집니다. 그렇기 때문에 매번 새로운 AI 비디오 생성기가 등장할 때마다 수천만 명이 주목하는 뉴스거리가 됩니다.
만약 당신이 ByteDance를 TikTok으로만 알고 있다면, 이 회사에 대해 몇 마디 덧붙이겠습니다. ByteDance는 중국의 가장 큰 AI 기업 중 하나이며, 비디오는 이들에게 매우 익숙한 영역입니다. 추천 피드, 편집, 효과 등이 모두 여기에 해당합니다. Seedance 라인업은 바로 이러한 전문성에서 성장했습니다.
이전 버전인 Seedance 2.0은 이미 주목할 만한 플레이어였습니다. 이에 대해서는 아래에서 별도로 다루겠습니다. 왜냐하면 현재 사운드가 포함된 독립적인 text-to-video (텍스트 투 비디오) 순위에서 1위를 차지하고 있는 것은 2.5가 아니라 바로 2.0이기 때문입니다. 따라서 Seedance 2.5 뒤에는 비디오 생성이 본업인 기업이 버티고 있으며, 모델 자체도 시장의 숙련된 플레이어가 내딛는 다음 단계입니다.
ByteDance는 의도적으로 2.1~2.4 버전을 건너뛰고 바로 2.5로 넘어갔습니다. The Next Web의 리뷰어 아나 마리아 콘스탄틴 (Ana Maria Constantin)은 이를 '세대적 도약'의 신호라고 설명했습니다. 즉, 변화가 너무 커서 세분화된 번호를 매기는 것이 오히려 불공정할 정도라는 것입니다. 구체적으로 무엇이 바뀌었을까요:
- 30초 원테이크 (One-shot). 이전 모델들(Seedance 2.0 및 경쟁 모델들)은 긴 영상을 5~10초 단위의 세그먼트(segment)로 자른 뒤 이어 붙이는 방식을 사용했습니다. 이 과정에서 빛이 튀거나 등장인물의 얼굴이 일그러지는 등 연결 부위의 이음새(seams)가 눈에 띄었습니다. Seedance 2.5는 단 한 번의 편집 없이 연속적인 30초 영상을 생성하는 최초의 AI 비디오 생성기라고 발표되었습니다.
- 50개의 멀티모달 레퍼런스 (Multimodal references). 텍스트뿐만 아니라 캐릭터 이미지, 오디오, 장면의 3D 더미(dummy), 스타일 샘플 등 최대 50개를 동시에 모델에 입력할 수 있습니다. 비교하자면 Seedance 2.0은 12개였으며, Google Veo 3.1은 단 3개만 수용합니다.
- 네이티브 4K 및 10비트 컬러 (Native 4K and 10-bit color). 저해상도에서 업스케일링(upscale)하는 방식이 아니라, 처음부터 4K로 이미지를 생성합니다. 또한 채널당 10비트(10-bit)를 지원하여 부드러운 그라데이션을 제공하며, 편집 시 색보정(color correction)을 위한 충분한 데이터 범위를 확보합니다.
- 로컬 프레임 편집 (Local frame editing). 등장인물의 머리카락 색이 잘못되었거나 배경에 불필요한 물체가 있는 경우, 30초 전체 클립을 다시 생성할 필요 없이 특정 영역만 다시 그릴 수 있습니다.
“세그먼트 스티칭(segment stitching), 장면 컷 스플라이싱(scene-cut splicing), 눈에 보이는 이음새(seams) 없이 단 한 번의 패스(single pass)로 연속적이고 끊김 없는 30초 비디오 클립을 생성함.”
- TechTimes, 2026년 6월 24일
혁신적인 이야기처럼 들립니다. 하지만 직접 사용해 보려 하기 전에, 생각보다 중요한 출시 상태에 관한 주의사항이 있습니다.
이미 출시된 것인가, 아니면 기업용 베타 버전인가?
요약: 2026년 7월 10일 기준으로 Seedance 2.5는 완전한 글로벌 출시 상태가 아니며, 단계적 출시(phased rollout)가 진행 중입니다. 모델은 기업용 베타 및 ByteDance의 소비자용 애플리케이션(Dreamina 및 Jimeng)에 공개되었으나, 공개 API는 아직 없습니다. Volcano Engine 및 BytePlus를 통한 접근은 7월 말 이후로 예정되어 있습니다. 모든 기술적 수치는 아직 독립적인 검증을 거치지 않은, 벤더(vendor)의 발표 자료에 기반한 것입니다.
이것은 사실과 보도자료를 구분하는 것이 중요한 사례입니다. 날짜별로 자세히 살펴보겠습니다.
6월 23일, 이 모델은 FORCE 무대에서 "enterprise beta already live", 즉 폐쇄형 기업용 베타 버전으로 공개되었으며, "7월 초"에 공개 출시(public launch)될 예정이라고 발표되었습니다. 7월 3일 기준으로 TechTimes는 "2026년 7월 3일 현재, 여전히 폐쇄형 기업용 베타 상태를 유지하고 있다"며 이전 상태를 기록했습니다. 출시 순서는 다음과 같습니다. 먼저 ByteDance의 자체 애플리케이션인 국제용 Dreamina와 중국용 Jimeng이 출시됩니다. 그다음 7월 중순에는 4억 명 이상의 활성 사용자를 보유한 영상 편집기 CapCut에 적용됩니다. 그리고 월말에 가까워져서야 Volcano Engine API와 국제 게이트웨이인 BytePlus ModelArk를 통한 외부 접근이 허용됩니다.
이것이 왜 중요한 원칙인가 하면, 만약 당신이 뉴스에서 "ByteDance가 30초짜리 AI 비디오 생성기를 출시했다"라는 글을 읽고 바로 API를 통해 연결할 수 있다고 판단한다면, 7월 10일 시점에서는 아직 그렇지 않기 때문입니다. 올바른 표현은 "파동형 출시(wave launch)가 진행 중이며, 소비자용 애플리케이션은 이미 부분적으로 공개되었고, 개발자용 API는 출시를 앞두고 있다"입니다.
두 번째 뉘앙스는 수치 자체에 관한 것입니다. 독립 기술 블로그인 TestingCatalog는 분석 과정에서 "30초에 대한 주장은 6월 23일 ByteDance 무대에서 나온 계획일 뿐이며, 아직 독립적인 검증을 거치지 않았다"라고 직접적으로 언급했습니다 (TestingCatalog, 2026년 7월 초).
간단히 말해, 편집 없는 30초 영상, 프롬프트 준수(prompt following) 정확도 20% 향상, 50개의 레퍼런스(reference) 등 이 모든 것은 아직 ByteDance가 무대 위에서 한 말일 뿐, 제3자의 테스트 결과가 아닙니다. 최대 3분 모드에 대한 루머도 돌고 있지만, 공식적인 확인은 없으며 상태는 "rumor/beta"입니다. 저는 기사에서 이 경계를 정직하게 유지하고 있습니다. 벤더의 발표인 부분은 "할 수 있다"가 아니라 "ByteDance가 주장한다"라고 작성합니다.
이것이 당신에게 실질적으로 무엇을 의미할까요? 만약 당신이 오늘 바로 이 AI 비디오 생성기를 사용해보고 싶다면, 7월 10일 기준으로 가장 현실적인 방법은 API가 아니라 소비자용 애플리케이션인 Dreamina를 통하는 것입니다. 자신의 제품에 비디오 생성을 통합하려는 개발자라면 Volcano Engine과 BytePlus의 오픈을 기다려야 합니다. 그리고 결제 문제도 미리 결정해야 합니다. 이 이야기의 다른 부분들과 마찬가지로, 러시아 카드는 결제가 되지 않습니다 (러시아에서의 접속 가능 여부에 대해서는 아래 별도 섹션에서 다룹니다).
🚨 중요. 새로운 모델의 출시 초기 단계에서 발표되는 구체적인 수치들은 독립적인 테스트 결과가 나오기 전까지 마케팅 용어로 읽어야 합니다. 이는 Seedance뿐만 아니라, 중국 연구소에서 만든 것이든 서구권에서 만든 것이든 새로운 AI 비디오 생성기의 모든 발표에 해당되는 사항입니다. 무대 위에서의 선언과 당신의 손에 쥐어진 결과물은 서로 다른 두 가지입니다.
편집 없는 30초와 50개의 레퍼런스는 무엇을 제공하는가?
요약: 편집 없는 30초 단일 샷은 AI 비디오의 주요 시각적 특징인 세그먼트 간의 '이음새(seams)'를 제거합니다. 그리고 50개의 레퍼런스(references)는 일관성(consistency) 문제를 해결합니다. 즉, 캐릭터, 제품, 스타일이 영상의 모든 장면에서 동일하게 유지됩니다. 모든 프레임에서 브랜드가 동일하게 보여야 하는 광고 분야에서는, 벤치마크 점수를 몇 점 더 올리는 것보다 이것이 훨씬 더 중요합니다.
이것이 이론이 아닌 실제 환경에서 왜 필요한지 분석해 보겠습니다.
편집 없는 길이. 비디오 생성의 표준적인 고충은 5~10초 이상의 클립을 여러 조각으로 이어 붙여야 한다는 점입니다. 각 연결 부위에서 모델은 주인공이 어떻게 생겼었는지 약간 '망각'하게 되고, 화면이 튀게 됩니다. 이음새를 감수하거나, Video Extension(비디오 확장) 기능을 위해 추가 비용을 지불하더라도 결국 싱크가 맞지 않는 현상을 겪게 됩니다. 연속적인 30초는 카메라 움직임, 샷의 전환, 동작의 전개가 포함된 완성된 장면을 촬영할 수 있는 기회를 제공하며, 중간에 흐름이 끊기는 일이 발생하지 않습니다.
50개의 레퍼런스. 이는 이번 발표에서 가장 과소평가된 수치입니다. 하나의 레퍼런스는 "이 이미지와 비슷하게 만들어줘"라는 뜻입니다. 하지만 50개는 "여기 8개 각도에서 본 주인공의 얼굴이 있고, 여기 그의 의상이 있으며, 여기 컵에 새겨진 로고가 있고, 여기 브랜드 팔레트가 있으며, 여기 카메라 움직임 샘플이 있고, 여기 립싱크(lipsync)를 위한 목소리가 있다"라는 뜻입니다. 모델은 이 모든 제약 조건을 동시에 유지하면서 영상을 제작합니다. 상업적 프로덕션(production)에서 이는 핵심적입니다. 광고가 반려되는 이유는 "예쁘지 않아서"가 아니라, 두 번째 프레임의 제품 색상이 첫 번째 프레임과 다르기 때문입니다.
참조(reference) 개수에 따른 이 단편의 수치는 다음과 같습니다:
| 모델 | 수용 가능한 참조 개수 |
|---|---|
| Google Veo 3.1 | 3 |
| ... | |
| 출처: The Next Web, 2026년 6월 23일 (모든 수치는 FORCE 발표에서의 ByteDance 측 주장임). |
로컬 편집 (Local editing). 이전에는 30초 분량의 영상에서 단 하나의 오류만 발생해도 전체를 다시 생성해야 했습니다. 클립 전체를 다시 계산하고, 비용을 다시 지불하며, 이번에는 모든 것이 제대로 맞기를 기도해야 했죠. 프레임의 특정 구역만을 정밀하게 수정할 수 있다는 것은 '운에 맡기는 방식'에서 '예측 가능한 프로덕션 (production)'으로의 전환을 의미합니다. The Next Web의 설명에 따르면, 구도, 조명, 카메라 움직임은 건드리지 않고도 캐릭터의 머리카락 색상이나 배경의 소품 같은 세부 사항을 변경할 수 있습니다.
두 가지 기능이 더 발표되었습니다: 네이티브 오디오 공동 처리 (native audio-co-processing, 소리가 영상 위에 덧씌워지는 것이 아니라 하나의 잠재 공간 (latent space) 내에서 영상과 함께 생성됨)와 초안 프리비즈 (previz)를 위한 3D 더미 (3D-bolvanka)입니다. 이 두 가지 모두 FORCE 무대에서 발표되었으나, 독립적인 검증은 이루어지지 않았습니다.
왜 소리를 영상과 함께 계산해야 할까요? 오디오를 별도로 붙일 경우, 캐릭터의 발걸음이 영상과 어긋나거나 문 닫히는 소리가 화면보다 0.5초 일찍 들리는 등의 문제가 발생합니다. 모델이 소리와 영상을 함께 계산하면 동기화 (synchronization)가 자연스럽게 이루어지며, 이는 생성 모델들이 보통 실패하는 바로 그 지점입니다. Seedance 2.5가 실제로 이를 구현하는지는 독립적인 테스트를 통해 확인해야 하겠지만, 아이디어 자체는 올바릅니다.
그리고 3D 더미 (white-box previz)는 복잡한 장면을 계획하는 사람들을 위한 것입니다. 먼저 모델이 객체의 배치와 카메라 움직임을 포함한 거친 회색 초안을 보여주면, 사용자는 저렴한 초안 단계에서 구도를 수정하고, 그 후에야 4K의 고비용 최종 생성을 실행합니다. 이는 카메라가 잘못된 방향으로 움직였다는 이유로 영상 전체를 다시 계산할 필요가 없게 만들어 시간과 비용을 모두 절약해 줍니다.
텍스트 렌더링은 별개의 이야기입니다. 거의 모든 AI 비디오 생성기들은 프레임 내의 글자를 제대로 쓰지 못합니다. 단어 대신 글자와 유사한 꼬불꼬불한 모양들이 뒤섞인 '글리프 수프 (glyph-soup)'가 나타나며, 키릴 문자(Cyrillic)의 경우 라틴 문자(Latin)보다 상황이 더 나쁩니다. ByteDance는 개선된 텍스트 렌더링을 2.5 버전의 별도 기능으로 내세우고 있습니다. 이것이 사실이라면 영상 내 러시아어 제목과 자막 구현에 큰 장점이 되겠지만, 이 역시 실제로 확인해 보아야 할 문제입니다.
Seedance vs Veo 3.1 및 Kling - 실제 선두는 누구인가?
요약: 2026년 7월 초 기준, Artificial Analysis Video Arena의 독립적인 순위에 따르면 상위권은 Veo나 Kling이 아닌 중국 모델들이 차지하고 있습니다. 바로 ByteDance의 Seedance 라인업과 최근까지 베일에 싸여 있던 Alibaba의 코드명 HappyHorse 프로젝트입니다. 중요한 주의사항이 있습니다. 현재 순위에는 2.5 버전이 아닌 Seedance 2.0이 반영되어 있습니다. 새로운 버전은 공개 API가 없어 아직 블라인드 테스트 (blind-testing)를 수행할 수 없기 때문입니다.
먼저, 비교 대상인 세 주인공에 대한 건조한 비교 표를 살펴보겠습니다. 모든 파라미터(Parameter)는 2026년 7월 10일 기준입니다.
| 파라미터 | Seedance 2.5 (ByteDance) | Google Veo 3.1 | Kling 3.0 (Kuaishou) |
|---|---|---|---|
| 최대 클립 길이 | 단일 샷으로 최대 30초 | API를 통한 짧은 범위 | 네이티브로 최대 15초 |
| ... | |||
| 출처: The Next Web (23.06.2026), Google Developers Blog (Veo 3.1), Kuaishou Technology 보도자료 (05.02.2026). Seedance 2.5의 가격은 공식적으로 발표되지 않았습니다 - 자세한 내용은 비용 섹션에서 다룹니다. |
이제 예상치 못한 부분입니다. 많은 이들이 '최고의 AI 비디오'라고 하면 Veo 대 Kling의 대결을 예상합니다. 하지만 실제 사람들이 두 영상 쌍을 블라인드로 비교하고 투표하는 블라인드 레이팅 (blind-rating)인 Artificial Analysis Video Arena를 살펴보면 양상은 다릅니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기