Flux 3, 이미지와 동시에 사운드트랙을 생성하다
요약
Black Forest Labs가 이미지, 비디오, 오디오를 동시에 생성하는 멀티모달 모델 Flux 3를 출시했습니다. 단일 네트워크를 통해 시각적 이벤트와 사운드를 완벽하게 동기화하며, 기존 비디오 모델의 한계였던 사운드 불일치 문제를 해결했습니다.
핵심 포인트
- 최대 20초 길이의 영상과 사운드트랙을 단일 패스로 생성
- Self-Flow 방식을 통해 시각 정보와 청각 정보의 정밀한 동기화 구현
- Runway Gen-4.5 대비 77%의 높은 성능 우위 기록
- 멀티모달 트랜스포머 기반의 통합된 내부 표현 학습
핵심 요약
- Black Forest Labs가 이미지, 비디오, 오디오를 함께 학습하여 최대 20초 길이의 네이티브 사운드트랙이 포함된 클립을 생성하는 멀티모달 (Multimodal) 모델인 Flux 3를 출시했습니다.
- 사운드는 더 이상 편집 후에 추가되지 않습니다. 동일한 네트워크가 단 한 번의 패스 (Pass)로 시각적 이벤트에 맞춰 소리를 정렬합니다.
- 내부 및 예비 테스트 결과, Flux 3는 77%의 비교에서 Runway Gen-4.5를 앞섰으며, Seedance 2.0 및 Gemini Omni Flash와는 대등한 수준(52%)을 기록했습니다.
지금까지 AI로 생성된 비디오는 소리가 없는 상태로 탄생했습니다. 모델이 애니메이션 이미지를 생성하면, 그다음 단계로 사운드트랙을 붙이고, 목소리를 더빙하고, 편집 과정에서 수동으로 맞춘 효과음을 입히는 과정이 이어졌습니다. 두 개의 직업, 두 개의 도구, 두 번의 작업이 필요했던 것입니다.
Black Forest Labs는 이 순서를 깨뜨렸습니다. 이들의 새로운 모델인 Flux 3는 최대 20초 길이의 클립에 대해 이미지와 사운드를 한 번의 동작으로 생성합니다. 문이 닫히는 소리, 발자국 소리, 적절한 언어로 말하는 문장까지 모두 픽셀과 동시에 동일한 네트워크에서 출력됩니다.
왜 사운드는 항상 마지막에 추가되었는가
전형적인 비디오 모델은 주로 이전 프레임을 바탕으로 다음 이미지를 예측하는 법을 학습합니다. 반면 오디오는 부수적인 레이어 (Layer)로 취급되어, 비디오가 고정된 후 다른 시스템에 의해 추가되었습니다. 이로 인해 입 모양과 소리가 맞지 않거나, 물체가 소리가 들리기 직전 찰나의 순간에 떨어지는 등의 고질적인 데모 결함이 발생했습니다.
문제는 사운드 자체의 품질이 아니라, 화면에서 일어나는 일과의 동기화 (Synchronization)에 있습니다. 현실을 묘사하기 위해서는 단일 모달리티 (Modality)만으로는 충분하지 않습니다. 이미지는 공간의 구조를 제공하고, 비디오는 그것이 어떻게 변화하는지 보여주며, 사운드는 기계적 이벤트와 그로 인해 발생하는 소리를 연결합니다. 이들을 분리하면 모델은 사후에 이 연결 고리를 추측해야만 합니다.
단일 네트워크가 보고 듣는 법을 배우는 방식
Flux 3는 Black Forest Labs가 Self-Flow라고 부르는 방식에 기반합니다. 이는 동일한 모델이 콘텐츠를 생성하는 동시에 이해하도록 훈련하는 방식입니다. 구체적으로, 멀티모달 트랜스포머 (Multimodal Transformer)는 이미지, 비디오, 오디오, 심지어 액션(action)에 특화된 인코더 (Encoder)와 디코더 (Decoder)를 갖추고 있으며, 이들은 각 스트림을 공통된 내부 표현 (Internal Representation)으로 변환한 다음 이를 다시 출력으로 재변환합니다.
오케스트라 이미지를 통해 이해를 도울 수 있습니다. 한 명의 지휘자가 모든 악기 섹션을 각자 따로 연습하게 하는 대신, 한꺼번에 연주하도록 이끄는 것과 같습니다. 세 가지 양식 (Modalities)을 함께 학습함으로써, 모델은 이들이 서로를 보완하도록 합니다. 즉, 이미지로 알 수 없는 장면의 정보는 소리나 움직임을 통해 보완합니다. Black Forest Labs는 이러한 통합된 기반이 생성 품질과 물리적 세계에 대한 이해 (Understanding of the physical world) 측면 모두에서 이전의 표준 방식인 플로우 매칭 (Flow-matching)을 능가한다고 주장합니다.
실제로 Flux 3는 텍스트-투-비디오 (Text-to-video), 이미지-투-비디오 (Image-to-video), 키프레임 (Keyframe) 기반 전환, 다국어 대화, 그리고 에이전트 (Agent)가 제어하여 더 긴 시퀀스를 구성하는 여러 샷 (Shot)의 연결을 처리합니다. 이 기업은 특히 얼굴 표정과 소리 및 그 소리를 유발하는 물리적 사건 사이의 일치성 측면에서 탁월한 능력을 보유하고 있다고 주장합니다.
고무적인 점수, 아직은 확인이 필요함
720p 해상도의 10초 클립을 대상으로 실시한 자체 평가에서, Black Forest Labs는 높은 사용자 선호도를 발표했습니다. Flux 3는 Runway Gen-4.5와의 비교에서 77%의 승률을 기록했으며, Luma Ray 3.2를 상대로는 93%의 승률을 보였습니다. 하지만 최고 수준의 모델들과의 격차는 눈에 띄게 좁혀졌습니다. Kling v3 Pro를 상대로는 60%를 기록했으며, Seedance 2.0 및 Gemini Omni Flash와는 단순한 무승부(52%)를 기록했습니다.
사실 네이티브 사운드 (native sound)의 원리는 새로운 것이 아닙니다. Google은 이미 2025년에 Veo를 통해 이미지에 대화와 효과음을 맞추는 최초의 소비자용 모델을 선보인 바 있습니다. Flux 3의 독특함은 아이디어 자체보다는 20초라는 지속 시간과 로보틱스 (robotics)와 공유하는 기반에 있습니다.
이 수치들은 예비적인 것이며 개발사 자체에서 제공한 것입니다. 아직 독립적인 테스트 결과는 나와 있지 않습니다. Seedance가 이미 포함되어 있는 선두 그룹에 합류했는지는 아직 증명되어야 할 과제로 남아 있습니다. 하지만 관건은 오늘의 순위가 아닙니다. 핵심은 리얼리즘 (realism)의 기준이 이동하고 있다는 점입니다. 오랫동안 어려움은 신뢰할 수 있는 이미지를 생성하는 데 있었으나, 이제는 단 한 번의 과정 (single pass)으로 보이는 것과 들리는 것 사이의 일관성을 유지하는 방향으로 옮겨가고 있습니다.
20초짜리 클립에서 로봇 팔까지
가장 흥미로운 부분은 화면 속에 있지 않습니다. 동일한 모델이 다음에 올 것(다음 이미지, 연관된 사운드)을 예측하는 법을 배우기 때문에, Black Forest Labs는 이를 행동으로 밀어붙이고 있습니다. 즉, 세상에 대한 이해를 바탕으로 동작을 예측하는 것입니다. 이 기업은 Mimic Robotics와 함께 Flux-mimic이라는 변형 모델을 개발했으며, 이는 이미 Audi의 생산 작업에서 테스트된 비디오-액션 (video-action) 모델입니다.
논리는 타당합니다. 다음 이미지를 예측하거나 기계 팔의 동작을 예상하는 것은 두 경우 모두 물리적 시스템의 다음 상태를 모델링하는 것입니다. 따라서 클립 생성기와 로봇의 두뇌는 동일한 중추(backbone)를 공유하게 될 것입니다. 데모에서 매우 인상적이었던 네이티브 오디오 (native audio)는 아마도 Black Forest Labs가 말하는 '실제 세계의 시각적 지능 (visual intelligence of the real world)'이라는 훨씬 더 광범위한 프로젝트의 가시적인 부분일 뿐일지도 모릅니다.
이 모델은 피드백을 위한 사전 액세스 (early access) 단계와 안전 테스트 단계를 거쳐 점진적으로 전개될 예정이며, 오픈 웨이트 (open-weight) 액세스도 발표되었습니다. 비디오 버전은 이미 출시되었으며, 이미지 생성은 향후 몇 주 내에 출시될 것으로 기대됩니다.
나의 의견
네이티브 오디오 (native audio)는 매우 빠르게 경이로운 기술에서 기대되는 최소한의 기능으로 변모할 것입니다. 여전히 별도의 오디오 처리 단계를 요구하는 생성기는 올해가 끝나기 전에 구식으로 보일 것입니다. 저의 관심을 끄는 것은 오히려 동일한 모델에 결합된 '액션 (action)' 모듈입니다. 일관된 비디오를 생성하는 것과 로봇의 동작을 제어하는 것은 '다음에 올 것을 예측한다'는 동일한 문제에 속하며, 저는 이 모델 제품군의 우위가 20초짜리 클립이 아니라 바로 이 지점에서 결정될 것이라고 믿습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기