Black Forest Labs, Sora 2 및 Runway Gen-4에 필적하는 멀티모달 비디오-액션 모델 FLUX 3 출시
요약
Black Forest Labs가 이미지, 비디오, 오디오를 통합 학습한 멀티모달 모델 FLUX 3를 출시했습니다. 이 모델은 동기화된 오디오가 포함된 20초 비디오 생성이 가능하며, 물리적 행동을 예측하는 FLUX-mimic 기능을 통해 로보틱스 분야로 확장성을 보여줍니다.
핵심 포인트
- 이미지, 비디오, 오디오를 단일 가중치로 공동 학습한 네이티브 멀티모달 모델
- 사후 처리 없이 동기화된 사운드가 포함된 최대 20초 비디오 생성
- 로보틱스 모방을 위한 FLUX-mimic 확장 기능 및 Audi 공장 테스트 진행
- OpenAI Sora 2 및 Runway Gen-4와 경쟁하는 차세대 비디오 생성 모델
요약 (Short answer)
Black Forest Labs는 2026년 7월 23일, 단일 공동 학습된 가중치 세트(set of weights)로부터 이미지, 동기화된 오디오가 포함된 최대 20초 길이의 비디오 클립, 그리고 예측된 물리적 행동을 네이티브하게 생성하는 최초의 주류 생성형 AI (generative AI) 모델인 FLUX 3를 출시했습니다. 정지 이미지에만 집중했던 이전의 FLUX 출시 버전들과 달리, FLUX 3는 로보틱스(robotics)를 모방하는 FLUX-mimic이라는 액션 예측 (action-prediction) 확장 기능도 함께 출시되었으며, 이는 이미 실제 Audi 공장 라인에서 테스트 중입니다.
핵심 요약 (Key Takeaways)
- 첫날부터 멀티모달 (Multimodal): FLUX 3는 모달리티 (modalities)를 사후에 추가하는 대신 이미지, 비디오, 오디오를 공동 학습하며, BFL은 이것이 더 강력한 교차 모달 이해 (cross-modal understanding)로 이어진다고 밝힙니다.
- 네이티브 오디오가 포함된 20초 비디오 클립: 출력물은 사후 립싱크 (lip-sync) 후처리가 아닌, 동기화된 사운드를 지원합니다.
- 로보틱스 확장 기능: FLUX-mimic은 물리적 행동을 예측하며, 이미 Audi 제조 시설에서 테스트를 위해 배치되었습니다.
- 현재는 조기 액세스만 가능: 비디오 및 액션 모듈은 API와 선정된 파트너를 통해 사용할 수 있으며, 전체 공개 배포는 추후 진행됩니다.
- 오픈 웨이트 (Open-weight) 개발자 에디션 계획: 개발자 친화적인 오픈 변형 모델이 2026년 후반에 출시될 예정입니다.
FLUX 3란 무엇인가? (What Is FLUX 3?)
FLUX 3는 Stability AI의 원년 연구원인 Max Borse, Felix Wilhelm, Patrick Esser가 설립한 베를린 기반 스튜디오 Black Forest Labs (BFL)에서 개발한 멀티모달 생성형 AI (generative AI) 모델입니다. FLUX 3를 발표하는 공식 보도 자료에 따르면, 이 모델은 "통합된 아키텍처 (architecture) 내에서 이미지, 비디오, 오디오로부터 공동으로 학습"하며 물리적 행동을 예측하도록 확장될 수 있습니다. 이는 정지 이미지에 집중했던 이전 FLUX 출시 버전들로부터의 근본적인 변화를 의미하며, 비디오 생성 분야에서 [OpenAI]의 Sora 2 및 Runway의 Gen-4와 직접적으로 경쟁하는 위치를 점하게 합니다.
BFL의 접근 방식은 비디오를 단순히 연속적인 프레임으로 취급하는 경쟁사들과 다릅니다. 대신, FLUX 3는 세 가지 모달리티 (modalities) 전체에 걸쳐 처음부터 동시에 학습되었습니다. VentureBeat는 학습 컴퓨팅 자원의 약 95%가 비디오 예측에 투입되었으며, 오디오는 학습 중 비디오 토큰의 0.5% 미만을 차지했다고 보도했습니다. 회사는 향후 몇 주 내에 전체 벤치마크 (benchmark) 결과를 발표할 예정입니다.
Self-Flow 아키텍처 설명
FLUX 3는 콘텐츠 생성과 해석을 모두 처리하는 BFL의 통합 생성 및 이해 시스템인 Self-Flow를 기반으로 작동합니다. Wan 2.7은 Self-Flow를 통해 모델이 별도의 모델 체크포인트 (checkpoints) 없이도 생성 작업 (프롬프트로부터 이미지나 비디오 생성)과 판별 작업 (방금 생성한 콘텐츠 이해) 사이를 전환할 수 있다고 보고했습니다. 이러한 양방향 능력은 단일 가중치 세트가 장면을 생성한 다음 자신의 출력물에 대해 추론할 수 있음을 의미하며, 이는 이전에는 여러 개의 특화된 모델을 체인 형태로 연결해야만 가능했던 일입니다.
이 아키텍처가 중요한 이유는 다단계 AI 파이프라인 (pipelines)을 괴롭혀온 파편화를 줄여주기 때문입니다. 다른 시스템들이 프레임을 생성하는 모델, 오디오를 추가하는 모델, 그리고 시간적 일관성 (temporal consistency)을 처리하는 모델을 각각 따로 필요로 하는 반면, FLUX 3의 Self-Flow는 하나의 학습된 경로를 통해 이 모든 것을 처리합니다. Decrypt는 이러한 통합된 설계 덕분에 개발자들이 서로 다른 모델 인스턴스를 로드할 필요 없이 이미지, 비디오, 오디오 생성 간을 전환할 수 있어, 실제 서비스 배포 시 추론 지연 시간 (inference latency)과 메모리 오버헤드 (memory overhead)를 줄일 수 있다고 보도했습니다.
네이티브 오디오를 포함한 비디오 생성
FLUX 3는 출력 스트림에 직접 내장된 네이티브 오디오 (native audio)와 함께 최대 20초 길이의 비디오 클립을 생성합니다. 이 오디오는 후반 작업의 립싱크 (lip-sync)나 별도의 생성 모델 (generative models)을 통해 추가되는 것이 아니라, 시각적 구성 요소와 함께 학습 과정에서 공동으로 학습됩니다. 이는 소리가 화면상의 이벤트와 자연스럽게 동기화됨을 의미합니다. VentureBeat는 20초 제한은 BFL 인프라의 현재 추론 예산 (inference budget)을 반영한 것이지만, 회사는 2026년 3분기 동안 컴퓨팅 비용 (compute costs)이 낮아짐에 따라 이를 연장할 계획이라고 언급했습니다.
초기 데모에 따르면 FLUX 3는 일관된 운동 물리 (motion physics) 및 조명 전환 (lighting transitions)과 함께 복잡한 다중 객체 장면 (multi-object scenes)을 처리할 수 있음을 보여주었으나, 일부 엣지 케이스 (edge cases)에서는 매우 역동적인 시퀀스에서 여전히 시간적 아티팩트 (temporal artifacts)가 발생합니다. 비디오 모듈은 현재 초기 액세스 파트너 및 일부 기업 고객을 위한 API를 통해 사용할 수 있습니다. BFL이 추론 클러스터 (inference cluster)를 확장함에 따라 표준 웹 인터페이스를 통한 공개 서비스는 가까운 시일 내에 예정되어 있습니다. 공식 출시 일정에 따르면 이미지 생성은 "앞으로 몇 주 안에" 별도로 제공될 예정입니다.
FLUX-Mimic: AI가 로보틱스를 만날 때
FLUX 3의 가장 예상치 못한 차원은 샌프란시스코의 스타트업 mimic robotics와 공동 개발한 행동 예측 (action-prediction) 확장 기능인 FLUX-mimic입니다. FLUX-mimic는 픽셀을 생성하는 대신 로봇이 실제 세계에서 실행할 수 있는 물리적 움직임을 예측합니다. mimic robotics의 자체 발표에 따르면, FLUX-mimic는 "FLUX 3를 기반으로 구축된 범용 로봇 행동 생성 모델 (general-purpose robot action generation model)"로 설명되며, 상위 수준의 지침 (high-level instructions)을 정밀한 로봇 제어 신호 (robotic control signals)로 변환합니다.
mimic robotics는 Audi를 포함한 제조 분야의 선두 기업들과 함께 이미 FLUX-mimic을 테스트하고 있음을 확인했습니다. 이 배포의 목표는 산업용 로봇이 수동 프로그래밍 대신 자연어 설명 (natural language descriptions)으로부터 새로운 조립 작업을 학습해야 하는 공장 환경을 겨냥합니다. 파트너사의 블로그 게시물에 따르면, 초기 테스트 결과 FLUX-mimic은 "기존의 티치 앤 리피트 (teach-and-repeat) 방식과 비교하여 새로운 제품 라인의 설정 시간을 최대 60%까지 단축했다"고 밝혔습니다. BFL은 해당 수치 이외의 구체적인 성능 지표 (performance metrics)를 공유하는 것은 거절했습니다.
이러한 로보틱스 측면은 FLUX 3를 순수하게 창의적인 비디오 제작 경쟁 모델들과 차별화합니다. Sora 2와 Runway Gen-4가 미디어 제작 유스케이스 (use cases)에 집중하는 반면, FLUX-mimic은 생성형 AI (generative AI)와 산업 자동화 (industrial automation)를 두 플랫폼 중 어느 것도 시도하지 않았던 방식으로 연결하며 실제 물리적 응용 분야로의 문을 열어줍니다.
FLUX 3와 Sora 2 및 Runway Gen-4의 비교
FLUX 3는 OpenAI의 Sora 2와 Runway의 Gen-4가 지배하고 있는 혼잡한 비디오 생성 시장에 진입하며, 이들은 대중적 인지도 면에서 각각 약 1년의 선점 효과를 누리고 있습니다. 경쟁적 포지셔닝은 두 가지 요소, 즉 멀티모달 깊이 (multimodal depth)와 조기 액세스 독점성 (early-access exclusivity)에 달려 있습니다. FLUX 3의 내부 평가를 다룬 Wan 2.7 게시물에 따르면, BFL의 예비 벤치마크 (benchmarks) 결과 여러 합성 품질 (synthetic quality) 측정 항목에서 ByteDance의 Seedance 2.0보다 앞선 것으로 보고되었습니다. Sora 2 및 Gen-4와의 직접적인 일대일 수치는 초기 출시 자료에 포함되지 않았습니다.
FLUX 3가 가져오는 핵심적인 이점은 네이티브 멀티모달리티 (native multimodality)입니다. Sora 2는 비디오를 생성하지만 오디오를 별도로 추가하며, Gen-4 역시 유사하게 사운드를 위해 후처리 파이프라인 (post-processing pipelines)에 의존합니다. FLUX 3의 공동 학습 (joint training)은 비디오, 이미지, 오디오가 사후에 짜깁기되는 것이 아니라 상호 의존적인 출력물로서 학습됨을 의미합니다. 이것이 측정 가능한 수준의 더 높은 품질로 이어질지는 공개 벤치마크가 나온 후에 확인될 것입니다.
가용성 및 액세스 로드맵 (Availability and Access Roadmap)
2026년 7월 23일, BFL은 초기 액세스 파트너들을 대상으로 API를 통해 FLUX 3의 비디오(Video) 및 액션(Action) 모듈을 공개했습니다. 이미지(Image) 모듈은 동일한 모델 제품군에 속함에도 불구하고, 향후 몇 주 내에 별도로 출시될 예정입니다. 개발자 친화적인 오픈 웨이트 (open-weight) 버전인 "Dev" 에디션은 2026년 하반기에 계획되어 있으며, 이를 통해 연구자들은 FLUX 3를 로컬 환경이나 자체 인프라에서 실행할 수 있게 됩니다.
보도 자료에 따르면, BFL은 2026년 3분기 동안 단계적으로 기능을 출시할 예정입니다. 아직 구체적인 가격 정보는 발표되지 않았습니다. 업계 관측통들은 FLUX.1 시리즈에서 보여준 BFL의 오픈 웨이트 배포 이력을 근거로, Dev 에디션 역시 가장 큰 모델들은 독점(proprietary)으로 유지하면서 중간 규모의 변형 모델들을 오픈 라이선스로 출시하는 유사한 패턴을 따를 것으로 보고 있습니다.
커뮤니티의 반응은 즉각적이었습니다. FLUX 3 발표는 게시된 지 몇 시간 만에 Hacker News에서 1위를 차지했으며, 아키텍처 선택, 미세 조정 (fine-tuning) 전략, 그리고 잠재적인 오용 벡터(misuse vectors)에 관한 수백 개의 댓글과 수십 개의 기술적 토론이 쌓였습니다.
FLUX 3가 중요한 이유
FLUX 3는 강력한 오픈 소스 신뢰성을 가진 팀이 통합 생성 모델 (unified generative models)을 향해 의미 있는 추진력을 보여주는 사례입니다. BFL의 이전 FLUX.1 출시작들은 오픈 웨이트 이미지 생성의 대중화에 기여했으며, FLUX 3는 그 철학을 여전히 기업용 API 뒤에 갇혀 있는 분야인 비디오와 오디오 영역으로 확장합니다.
로보틱스 확장 기능은 또 다른 차원의 중요성을 더합니다. 생성형 비디오 모델 (Generative video models)과 물리적 행동 예측 (Physical action prediction)을 결합하는 것은 BFL을 미개척 영역으로 인도합니다. 딥테크 연구소(Deep-tech labs) 외부의 팀 중 디지털 캔버스가 아닌 실제 세상에 영향을 미치는 교차 모달 모델 (Cross-modal models)을 시도한 곳은 거의 없습니다. 만약 Audi와의 파트너십이 초기 테스트를 넘어 측정 가능한 결과를 전달한다면, FLUX-mimic은 AI 지원 산업 자동화 (AI-assisted industrial automation)의 새로운 카테고리를 구축할 수 있습니다.
콘텐츠 제작자들에게 텍스트 프롬프트 (Text prompts)로부터 동기화된 오디오가 포함된 비디오를 생성하는 단일 모델의 약속은 매우 매력적입니다. 연구자들에게는 셀프-플로우 (Self-flow) 아키텍처가 생성-이해 하이브리드 시스템 (Generative-understanding hybrid systems)을 위한 테스트 베드를 제공합니다. 그리고 더 넓은 AI 산업 측면에서, FLUX 3의 단계적 출시 전략은 프런티어 생성형 모델 (Frontier generative models)에 대한 수요를 관리하는 사례 연구 역할을 할 것입니다.
결론
Black Forest Labs의 FLUX 3는 Self-Flow 아키텍처와 산업급 로보틱스 확장을 바탕으로 이미지, 비디오, 오디오의 공동 생성을 지원하며 첫 번째 주요 멀티모달 돌파구를 마련했습니다. 이 모델의 야심 찬 능력과 현재의 제한된 가용성 사이의 간극은 2026년 3분기로 향하는 주요 불확실성입니다.
AI 도구의 능력이 향상됨에 따라, 디지털로 창조할 수 있는 것과 물리적으로 실행할 수 있는 것 사이의 경계는 점점 더 얇아지고 있습니다. FLUX 3는 의도적으로 그 경계를 밀어붙이는 첫 번째 모델 중 하나이며, 향후 몇 달간의 출시 과정은 BFL의 단계적 접근 방식이 추진력을 얻을지, 아니면 경쟁사들이 시장을 공고히 하도록 내버려 둘지를 보여줄 것입니다. 어느 쪽이든, 멀티모달 모델 경쟁은 훨씬 더 흥미로워졌습니다.
자주 묻는 질문 (FAQ)
FLUX 3란 무엇이며 언제 출시되었나요?
FLUX 3는 Black Forest Labs가 개발한 멀티모달 생성형 AI 모델로, 단일 학습 가중치 (Trained weights) 세트로부터 이미지, 네이티브 오디오가 포함된 최대 20초 길이의 비디오 클립, 그리고 예측된 물리적 행동을 공동으로 생성합니다. 2026년 7월 23일에 공식 발표되었습니다.
FLUX 3와 이전 FLUX 모델의 차이점은 무엇인가요?
FLUX.1과 같은 이전 FLUX 모델들은 정지 이미지 생성 (still image generation)에만 전적으로 집중했습니다. FLUX 3는 동일한 기본 아키텍처 (base architecture)를 비디오와 오디오로 확장하는 동시에, 로보틱스 (robotics) 애플리케이션을 위한 FLUX-mimic이라는 행동 예측 모듈 (action-prediction module)을 추가하여, 단일 출력 도구가 아닌 진정한 멀티모달 (multimodal) 플랫폼으로 거듭났습니다.
FLUX 3를 지금 바로 대중이 사용할 수 있나요?
아니요. 2026년 7월 23일 현재, 비디오 (Video) 및 액션 (Action) 모듈만 API 키와 선택된 파트너 계약을 통해 사용할 수 있습니다. 이미지 (Image) 모듈은 향후 몇 주 내에 출시될 예정이며, 완전한 공개 출시 또는 오픈 웨이트 (open-weight) Dev 에디션의 확정된 날짜는 아직 발표되지 않았습니다.
FLUX-mimic이란 무엇이며 어떻게 사용되나요?
FLUX-mimic은 mimic robotics와 함께 개발된 FLUX 3의 행동 예측 (action-prediction) 확장 기능입니다. 픽셀을 생성하는 대신, 텍스트 지시 사항으로부터 물리적인 로봇의 움직임을 예측합니다. 현재 Audi 공장 라인에서 자동 조립 작업을 위해 테스트 중입니다.
FLUX 3는 Sora 2 및 Runway Gen-4와 비교했을 때 어떠한가요?
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기