
Flux 3, BFL 테스트에서 Seedance 2.0을 앞서며 비디오에 네이티브 오디오 추가
요약
Black Forest Labs가 네이티브 오디오가 포함된 최대 20초 분량의 비디오를 생성하는 멀티모달 모델 Flux 3를 출시했습니다. 이 모델은 텍스트, 이미지, 비디오, 오디오를 동시에 학습하여 물리적 환경을 인지하는 월드 모델 구축을 목표로 합니다.
핵심 포인트
- 최대 20초 길이의 네이티브 오디오 포함 비디오 생성 가능
- 텍스트/이미지/비디오 투 비디오 및 에이전트 기반 클립 체이닝 지원
- 내부 테스트 결과 Seedance 2.0 및 Luma Ray 3.2 대비 높은 선호도 기록
- 실세계 시각 지능을 갖춘 월드 모델 구축을 지향
Black Forest Labs는 네이티브 오디오가 포함된 20초 분량의 비디오를 생성하는 멀티모달 (multimodal) 모델인 Flux 3를 출시했습니다. 내부 테스트에서는 Seedance 2.0 대비 52%의 선호도를 주장하지만, 독립적인 결과는 아직 대기 중입니다.
Black Forest Labs는 2026년 7월, 네이티브 오디오가 포함된 20초 분량의 비디오를 생성하는 멀티모달 파운데이션 모델 (multimodal foundation model)인 Flux 3를 출시했습니다. BFL의 내부 테스트에 따르면 ByteDance의 Seedance 2.0보다 52% 높은 선호도를 보인다고 주장하지만, 독립적인 벤치마크 (benchmarks) 결과는 아직 나오지 않았습니다.
주요 사실 (Key facts)
- Flux 3는 네이티브 오디오가 포함된 최대 20초 분량의 비디오를 생성합니다.
- BFL은 Luma Ray 3.2 대비 93%의 선호도를 주장합니다.
- 내부 테스트에서 Seedance 2.0 대비 52%의 선호도를 기록했습니다.
- Mimic Robotics와의 파트너십을 통해 Audi에서 Flux-mimic을 테스트했습니다.
- Flux 3 Image의 조기 액세스 (early access)가 몇 주 내로 계획되어 있습니다.
The Decoder에 따르면, Black Forest Labs (BFL)는 이미지, 비디오, 오디오를 동시에 학습하는 멀티모달 파운데이션 모델 (multimodal foundation model)인 Flux 3를 출시했습니다. BFL의 제품 라인업 중 처음으로, Flux 3는 최대 20초 길이의 네이티브 오디오가 포함된 비디오를 생성하며, 텍스트-투-비디오 (text-to-video), 이미지-투-비디오 (image-to-video), 비디오-투-비디오 (video-to-video), 키프레임 기반 전환 (keyframe-based transitions), 다국어 대화 (multilingual dialogue), 그리고 더 긴 시퀀스를 위한 에이전트 기반 클립 체이닝 (agent-driven clip chaining)을 지원합니다. BFL은 이 모델을 "실세계 시각 지능 (real-world visual intelligence)"을 향한 단계로 설명하며, 물리적 및 디지털 환경 전반에서 인지하고, 예측하고, 행동하는 월드 모델 (world models) 구축을 목표로 하고 있습니다.
핵심 요약 (Key Takeaways)
- Black Forest Labs는 네이티브 오디오가 포함된 20초 분량의 비디오를 생성하는 멀티모달 (multimodal) 모델인 Flux 3를 출시했습니다.
- 내부 테스트에서는 Seedance 2.0 대비 52%의 선호도를 주장하지만, 독립적인 결과는 아직 대기 중입니다.
내부 벤치마크는 Seedance 2.0에 대한 근소한 우위를 보여줌
720p 해상도의 10초 클립을 사용한 초기 평가에서, BFL은 Flux 3가 Luma Ray 3.2와의 비교에서 93%, Runway Gen-4.5와의 비교에서 77%, 그리고 Grok Imagine Video와의 비교에서 69%의 확률로 더 선호되었다고 보고했습니다. 더 강력한 경쟁자들과의 격차는 좁혀집니다. Flux 3는 Kling v3 Pro를 60%의 확률로, Happy Horse v1을 59%, Happy Horse 1.1을 57%의 확률로 앞섰으며, 2026년 2월 Jimeng AI에서 처음 관찰된 ByteDance의 비디오 생성 모델인 Seedance 2.0과 Gemini Omni Flash에 대해서는 각각 52%의 선호도를 기록했습니다. BFL은 이러한 결과가 예비적(preliminary)임을 명시적으로 밝히고 있으며, 아직 독립적인 테스트 결과는 존재하지 않습니다. 이미 할리우드 제작 파이프라인에 진입한 Seedance 2.0과 대등한 수준에 도달한다면, Flux 3는 최상위 비디오 모델 반열에 오르게 될 것입니다.
로보틱스와 월드 모델(world models)로 가는 경로
Flux 3는 BFL의 독자적인 방식인 Self-Flow를 기반으로 하며, 회사는 이를 통해 복잡한 프롬프트에 대한 이미지 생성 능력과 정확한 다국어 텍스트 렌더링(text rendering) 능력이 향상될 것으로 기대하고 있습니다. BFL은 몇 주 내에 Flux 3 Image를 얼리 액세스(early access)로 출시할 계획입니다. 이와 별도로, 회사는 Mimic Robotics와 협력하여 Flux-mimic을 개발했으며, 이 비디오-액션(video-action) 모델은 현재 Audi의 생산 작업에서 테스트 중입니다. 이러한 로보틱스 응용 분야는 단순히 미디어를 생성하는 것을 넘어, 물리적 환경에서 행동할 수 있는 파운데이션 모델(foundation model)을 구축하겠다는 BFL의 포부를 강조합니다.
주목해야 할 점
몇 주 내로 예상되는 Flux 3와 Seedance 2.0 및 Gemini Omni Flash를 비교하는 독립적인 제3자 벤치마크를 주목하십시오. 또한 Flux 3 Image의 얼리 액세스 출시와 Flux-mimic에 대해 공개될 Audi의 생산 결과도 추적해 보시기 바랍니다.
출처: the-decoder.com
원래 게재된 곳: gentic.news
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기
