FLUX 모델의 오랜 업데이트 소식
요약
Black Forest Labs가 이미지, 비디오, 오디오, 로봇 동작 예측을 하나의 통합 아키텍처로 처리하는 FLUX 3를 공개했습니다. 멀티모달 백본을 통해 콘텐츠 생성과 물리적 세계의 지능을 동일한 시각 기초 모델 위에서 구현한 것이 특징입니다.
핵심 포인트
- FLUX 3는 이미지, 비디오, 오디오, 로봇 동작을 통합 처리하는 멀티모달 모델임
- 통합 아키텍처를 통해 콘텐츠 제작과 물리적 세계 이해를 동일 체계로 연결
- 비디오 기능은 현재 얼리 액세스 중이며 향후 가중치 공개 예정
- 실제 로봇 구동 테스트를 통해 물리적 동작 예측 성능 입증
FLUX 모델의 업데이트를 정말 오랜만에 보네요~
FLUX 3는 이미지, 비디오, 오디오, 그리고 로봇 동작 예측(robot action prediction)을 하나의 모델에 담았습니다.
Black Forest Labs는 이번에 바로 통합 아키텍처(unified architecture)를 선보였으며, 하나의 멀티모달 백본(multimodal backbone)이 이미지 생성, 비디오, 네이티브 오디오(native audio)를 동시에 처리하고, 심지어 로봇 동작 예측까지 확장할 수 있습니다.
현재 비디오는 얼리 액세스(early access)가 오픈되었으며, 향후 가중치(weights)도 공개될 예정입니다. 또한 이미 mimic, Audi와 협력하여 실제 로봇에서 구동하는 데 성공했습니다.
이것은 단순히 "몇 가지 모달리티(modality)를 추가한 것"이 아닙니다. 그들은 물리 세계의 지능과 콘텐츠 제작이 본질적으로 동일한 시각 기초 모델(vision foundation model) 위에서 작동할 수 있다고 명확히 제시하고 있습니다.
실제 비디오를 생성하는 것과 로봇이 어떻게 움직여야 하는지를 예측하는 것은, 세계에 대한 동일한 이해 체계를 공유합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @berryxia (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기