
ByteDance Seedance 2.5, 단 한 번의 실행으로 30초 영상 생성
요약
ByteDance가 단 한 번의 생성 패스로 30초 길이의 영상을 제작할 수 있는 Seedance 2.5를 출시했습니다. 이미지, 비디오, 오디오 참조를 활용한 멀티모달 컨디셔닝을 통해 긴 내러티브 생성을 지원합니다.
핵심 포인트
- 단 한 번의 패스로 30초 분량의 일관된 영상 생성 가능
- 이미지 30개, 비디오 10개, 오디오 10개의 멀티모달 참조 지원
- 다회차 확장 체인을 통한 장기 내러티브 구현 지원
- 타임스탬프 제어 편집 기능을 통한 정밀한 수정 가능
ByteDance의 Seedance 2.5는 30개의 이미지, 10개의 비디오, 10개의 오디오 참조를 사용하여 단 한 번의 패스(one pass)로 30초 영상을 생성합니다. 이는 2026년 2월의 Seedance 2.0의 뒤를 잇는 모델입니다.
ByteDance의 Seed 팀은 2026년 7월 말 Seedance 2.5를 출시하여, 단 한 번의 생성 패스로 30초 길이의 비디오 클립을 제작할 수 있게 했습니다. 이는 Seedance 2.0의 일반적인 단일 샷(single-shot) 출력 길이를 세 배로 늘린 것입니다.
주요 사실 (Key facts)
- Seedance 2.5는 단 한 번의 패스로 30초 영상을 생성함
- 30개의 이미지, 10개의 비디오, 10개의 오디오 참조를 지원함
- 다회차 확장 체인(Multi-round extension chains)을 통한 더 긴 내러티브 지원
- Seedance 2.0은 2026년 2월 16일 Jimeng AI에서 데뷔함
- 정밀한 수정을 위한 타임스탬프 제어 편집(Timestamp-controlled editing) 지원
이번 업데이트는 모델의 범위를 단순한 재생 시간 이상으로 확장합니다. ByteDance Seedance 2.5 출시 정보에 따르면, 새 버전은 단일 프롬프트에서 최대 30개의 이미지 참조, 10개의 비디오 참조, 10개의 오디오 참조를 지원하며, 이는 멀티모달 컨디셔닝 (multi-modal conditioning) 측면에서 상당한 도약입니다. 회사는 이를 단순한 긴 클립 생성기가 아닌, 긴 내러티브 (long-narrative) 도구로 포지셔닝하고 있습니다.
핵심 요약 (Key Takeaways)
- ByteDance의 Seedance 2.5는 30개의 이미지, 10개의 비디오, 10개의 오디오 참조를 사용하여 단 한 번의 패스로 30초 영상을 생성합니다.
- 2026년 2월의 Seedance 2.0의 뒤를 잇습니다.
30초 생성 기능이 워크플로를 변화시키는 방식

2026년 2월 16일 ByteDance의 Jimeng AI 플랫폼에서 데뷔한 Seedance 2.0은 일반적으로 확장된 장면을 위해 여러 번의 패스가 필요한 더 짧은 클립을 생성했습니다. Seedance 2.5는 해당 파이프라인을 축소합니다. 즉, 한 번의 생성 호출로 30초의 일관된 푸티지 (footage)를 얻을 수 있습니다. 제작 팀의 경우, 이는 단일 샷을 위해 필요한 API 왕복 횟수를 줄여 지연 시간 (latency)과 세그먼트 간의 스타일 드리프트 (style drift) 위험을 모두 감소시킵니다.
다회차 확장 (multi-round extension) 기능은 연속적인 생성을 체인(chain) 형태로 연결하여, 내러티브가 기본 30초를 훨씬 넘어 확장될 수 있도록 합니다. 타임스탬프 제어 편집 (timestamp-controlled editing) — 창작자가 타임라인의 특정 시점을 지정하여 정밀한 수정을 할 수 있는 기능 — 과 결합되어, 이 모델은 단순한 텍스트-투-비디오 (text-to-video) 생성기를 넘어 제어 가능한 비디오 편집기에 더 가까워지고 있습니다.
멀티모달 참조 (Multi-modal references): 이미지 30장, 비디오 10개, 오디오 클립 10개

Seedance 2.5는 밀도 높은 참조 스택 (reference stack)을 수용합니다. 창작자는 캐릭터 일관성 (character consistency)을 위해 30장의 이미지, 동작 참조 (motion reference)를 위한 10개의 비디오 클립, 그리고 대화나 주변음을 위한 10개의 오디오 트랙을 입력할 수 있습니다. 이는 일반적으로 소수의 이미지와 단일 오디오 입력으로 제한되는 대부분의 경쟁 모델들과 비교했을 때 현저히 높은 수준입니다.
회사는 학습 컴퓨팅 (training compute), 파라미터 수 (parameter count), 또는 생성당 추론 비용 (inference cost)을 공개하지 않았습니다. 가격 책정 및 API 가용성 세부 사항 또한 이번 발표에서는 명시되지 않았으나, 이 모델은 향후 몇 주 내에 ByteDance의 Jimeng AI 플랫폼과 Volcano Engine 엔터프라이즈 API에 출시될 것으로 예상됩니다.
관전 포인트
Seedance 2.5가 Volcano Engine API와 Jimeng AI에 출시될 때, 생성당 가격이 30초 생성 능력을 다회차 방식 (multi-pass)의 대안들과 비교했을 때 비용 경쟁력이 있는지 지켜봐야 합니다. 또한, 2026년 7월 말 BFL 테스트에서 Seedance 2.0을 앞질렀던 Flux 3와의 벤치마크 비교 결과도 주목할 만합니다.
출처: pandaily.com
[08월 01일 업데이트, scmp_tech 제공]
경쟁 구도가 가열되고 있습니다: MiniMax는 오픈 웨이트 (open weights) 방식이며 초당 0.8위안의 가격을 책정하여 ByteDance의 폐쇄형 소스 (closed-source) 방식에 직접적으로 도전하는 경쟁 비디오 생성 모델인 H3를 출시했습니다 [SCMP 보도]. H3는 15초 분량의 2K 네이티브 듀얼 채널 오디오-비디오 생성을 지원하며, 현재 벤치마크 플랫폼인 Artificial Analysis의 비디오 편집 부문에서 1위를 기록하고 있으나, 텍스트-투-비디오 (text-to-video) 작업에서는 Google의 Gemini Omni Flash에 뒤처지고 있습니다 [Pandaily 보도].
원문 게시: gentic.news
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기