Xiaomi-Robotics-U0: 통합된 Embodied Synthesis를 위한 380억 파라미터 모델
요약
Xiaomi가 발표한 Xiaomi-Robotics-U0는 380억 파라미터 규모의 멀티모달 자기회귀 모델로, Embodied AI를 위한 통합 생성 프레임워크를 제공합니다. 기존 모델의 일반화 능력을 유지하면서 다중 뷰 일관성과 기하학적 일관성을 확보하여 로봇 시나리오에 최적화되었습니다.
핵심 포인트
- 380억 파라미터 규모의 멀티모달 자기회귀 모델
- 텍스트-이미지, 장면 생성, Embodied 전이 등 통합 최적화
- 다중 뷰 및 기하학적 일관성 확보를 통한 로봇 환경 적응
- 로봇의 물리적/운영적 제약 조건을 고려한 생성 지원
변경된 사항
이미지 및 비디오 생성을 위한 기존의 파운데이션 모델 (Foundation models)은 일반화 능력과 제어 가능성 측면에서 강력하지만, Embodied (체화된) 시나리오에 직접 적용할 때는 한계에 직면합니다. 이러한 한계는 다중 뷰 일관성 (Multi-view consistency), 기하학적 일관성 (Geometric coherence), 그리고 특정 로봇의 Embodiment (체화) 제약 조건의 필요성에서 비롯됩니다. 기존의 접근 방식은 종종 제한된 로봇 전용 데이터를 사용하여 이러한 파운데이션 모델을 적응시키는데, 이는 대규모 사전 학습 (Pre-training) 동안 습득한 광범위한 시각적 지식을 의도치 않게 손상시킬 수 있습니다.
Xiaomi-Robotics-U0는 Embodied 생성을 파운데이션 이미지 및 비디오 생성의 직접적인 확장으로 취급함으로써 중요한 변화를 도입합니다. 이 380억 파라미터 (38-billion-parameter) 규모의 멀티모달 자기회귀 모델 (Multimodal autoregressive model)은 통합된 Embodied Synthesis를 위해 설계되었습니다. 단순히 기존 모델을 적응시키는 대신, Xiaomi-Robotics-U0는 텍스트-투-이미지 (Text-to-image) 생성, 이미지 편집 (Image editing), Embodied 장면 생성 (Embodied scene generation), Embodied 전이 (Embodied transfer), 그리고 Embodied 비디오 생성 (Embodied video generation)과 같은 일련의 생성 작업들을 공동으로 최적화합니다. 이 통합 프레임워크는 기반이 되는 사전 학습된 월드 파운데이션 모델 (World foundation model)의 일반화 강점을 유지하면서, 이를 Embodied 환경의 복잡성에 효과적으로 적응시키도록 설계되었습니다. 특히 이 모델은 다양한 로봇 Embodiment에 걸쳐 고품질의 다중 뷰 장면 생성을 지원하고, 다중 뷰 일관성과 상호작용 역학을 유지하면서 세밀한 편집을 위한 구조화되고 제어 가능한 Embodied 전이를 제공하는 최초의 모델입니다.
기술적 세부 사항
Xiaomi-Robotics-U0는 380억 파라미터 규모의 멀티모달 자기회귀 모델 (Multimodal autoregressive model)로 작동합니다. 핵심적인 기술 혁신은 단일 최적화 프로세스 내에서 여러 생성 작업을 통합하는 통합 프레임워크에 있습니다. 이는 특정 Embodied 작업을 위해 사전 학습된 모델을 미세 조정 (Fine-tuning)하거나 적응시키는 기존 방식과 대조되며, 기존 방식은 잠재적으로 일반적인 시각적 지식의 손실을 초래할 수 있습니다.
모델의 아키텍처는 Embodied AI (체화된 인공지능)의 고유한 요구 사항을 처리하도록 설계되었습니다. 여기에는 생성된 장면이 서로 다른 관점에서도 일관성을 유지하는 다중 뷰 일관성 (multi-view consistency)과 현실적인 물리적 상호작용에 필수적인 기하학적 일관성 (geometric coherence)을 보장하는 것이 포함됩니다. 또한, 로봇 체화 제약 조건 (robot embodiment constraints)을 통합하여, 생성된 콘텐츠가 다양한 로봇 형태의 물리적 및 운영적 제한 사항과 호환되도록 합니다.
Xiaomi-Robotics-U0의 주요 기능은 다음과 같습니다:
- 텍스트-이미지 생성 (Text-to-Image Generation): 텍스트 설명으로부터 정적인 이미지를 생성합니다.
- 이미지 편집 (Image Editing): 프롬프트나 조건에 따라 기존 이미지를 수정합니다.
- 체화된 장면 생성 (Embodied Scene Generation): 로봇 상호작용에 적합하도록 일관되고 기하학적으로 견고한 복잡한 다중 뷰 장면을 생성합니다.
- 체화된 전이 (Embodied Transfer): 체화된 장면 내에서 요소나 스타일의 구조화되고 제어 가능한 전이를 가능하게 하여, 일관성과 상호작용 역학을 유지하면서도 세밀한 편집을 허용합니다.
- 체화된 비디오 생성 (Embodied Video Generation): 체화된 맥락에서 로봇의 행동과 환경 변화를 묘사하는 역동적인 비디오 시퀀스를 제작합니다.
이러한 다양한 작업에 걸친 공동 최적화 (joint optimization)를 통해 Xiaomi-Robotics-U0는 월드 파운데이션 모델 (world foundation model)의 광범위한 시각적 이해력을 활용하는 동시에, 체화된 지능 (embodied intelligence)에 필요한 특정 뉘앙스를 학습할 수 있습니다. 이 접근 방식은 범용 모델을 매우 전문화된 도메인에 적응시킬 때 흔히 관찰되는 시각적 지식의 저하를 방지하는 것을 목표로 합니다.
벤치마크 분석 (Benchmark Analysis)
Xiaomi-Robotics-U0는 다양한 단일 단계 및 순차적 생성 작업에서 최첨단 (state-of-the-art) 성능을 입증했습니다. 체화된 장면 생성 및 전이에 대한 인간 평가에서 GPT-Image-2.0보다 뛰어난 성능을 보였습니다. 또한, 이 모델은 체화된 비디오 생성 분야의 World Arena에서 1위를 차지했습니다.
도전적인 실제 환경의 조작(manipulation) 작업에서, Xiaomi-Robotics-U0는 pi_0.5의 분포 외(out-of-distribution) 성공률을 36.9%에서 63.2%로 향상시켰습니다. 이러한 결과는 파운데이션 월드 모델(foundation world models)이 체화된 월드 모델(embodied world models)이자 체화된 지능(embodied intelligence)을 위한 확장 가능한 데이터 엔진(scalable data engines)으로서 효과적으로 기능할 수 있음을 나타냅니다.
개발자 시사점 (Developer Implications)
로보틱스, 체화된 AI(embodied AI), 그리고 생성 모델(generative models) 분야에서 활동하는 개발자들에게 Xiaomi-Robotics-U0는 강력한 새로운 도구를 제공합니다. 다양한 로봇 형태(robot embodiments)에 걸쳐 고품질의 다중 뷰 장면 생성(multi-view scene generation)을 수행하는 이 모델의 능력은 다양하고 현실적인 시뮬레이션 환경 구축을 단순화합니다. 이는 종종 비용이 많이 들고 시간이 소요되는 광범위한 실제 데이터 수집 없이도 로봇 제어 정책(robot control policies) 및 인지 시스템(perception systems)의 개발과 테스트를 가속화할 수 있습니다.
구조화되고 제어 가능한 체화된 전이(embodied transfer)의 도입은 개발자에게 장면 편집(scene editing)에 대한 세밀한 제어권을 제공합니다. 이러한 능력은 로봇 작업 설계의 반복, 환경 파라미터 조정, 또는 특정 상호작용 역학(interaction dynamics)을 정밀하게 시뮬레이션하는 데 매우 중요합니다. 편집 과정 중 다중 뷰 일관성(multi-view consistency)과 상호작용 역학을 보존함으로써, 생성된 콘텐츠가 물리적으로 타당하며 훈련 또는 평가에 유용하게 유지되도록 보장합니다.
나아가, 체화된 비디오 생성(embodied video generation)에서의 강력한 성능은 시각 기반 로봇 시스템을 훈련하기 위한 합성 데이터셋(synthetic datasets)을 생성하는 데 도움을 주어, 데이터의 다양성과 강건성(robustness)을 향상시킬 수 있습니다. 조작 작업에서의 향상된 분포 외(out-of-distribution) 성공률은 Xiaomi-Robotics-U0와 같은 모델이 더욱 일반화되고 강건한 로봇 행동에 기여할 수 있음을 시사하며, 잠재적으로 심투리얼(sim-to-real) 격차를 줄일 수 있습니다.
개발자들은 제공된 링크(robotics.xiaomi.com/xiaomi-robotics-u0.html)를 통해 코드와 체크포인트(checkpoints)에 접근할 수 있으며, 이를 통해 자신의 프로젝트에 이 모델을 통합하고 실험할 수 있습니다. 이러한 접근성은 체화된 AI 분야의 추가적인 연구와 애플리케이션 개발을 촉진합니다.
결론 (Bottom Line)
Xiaomi-Robotics-U0는 체화된 AI (Embodied AI) 및 생성 모델링 (Generative Modeling) 분야의 중대한 발전을 나타냅니다. 380억 개의 파라미터를 가진 멀티모달 자기회귀 (Multimodal Autoregressive) 프레임워크 내에서 다양한 생성 작업들을 통합함으로써, 범용 파운데이션 모델 (General-purpose Foundation Models)과 체화된 시나리오의 특수한 요구사항 사이의 간극을 효과적으로 메웁니다. 사전 학습된 월드 모델 (World Models)의 일반화 능력을 유지하면서도 다중 뷰 일관성 (Multi-view Consistency), 기하학적 일관성 (Geometric Coherence), 그리고 로봇 체화 (Robot Embodiment) 제약 조건에 적응하는 이 모델의 능력은 핵심적인 차별점입니다.
특히 체화된 장면 생성 및 전이 (Embodied Scene Generation and Transfer)에 대한 인간 평가에서 GPT-Image-2.0을 능가하고, World Arena의 체화된 비디오 생성 (Embodied Video Generation) 부문에서 최상위 순위를 기록하는 등 강력한 벤치마크 성능은 이 모델의 역량을 입증합니다. 실제 환경의 조작 작업 (Real-world Manipulation Tasks)에 대한 분포 외 (Out-of-distribution) 성공률의 상당한 향상은 더욱 견고하고 적응력 있는 로봇 시스템을 구동할 수 있는 잠재력을 강조합니다.
궁극적으로 Xiaomi-Robotics-U0는 대규모 파운데이션 월드 모델이 두 가지 역할을 수행할 수 있음을 보여줍니다. 즉, 복잡한 상호작용을 시뮬레이션하기 위한 정교한 체화된 월드 모델 (Embodied World Models)로서의 역할과, 체화된 지능 (Embodied Intelligence)을 발전시키는 데 필수적인 고품질의 다양한 데이터를 생성하는 확장 가능한 데이터 엔진 (Data Engines)으로서의 역할입니다. 이 연구는 파운데이션 모델이 어떻게 확장되어 더 지능적이고 유능한 로봇 에이전트 (Robotic Agents)를 생성하는 데 적용될 수 있는지에 대한 새로운 선례를 세웁니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기