Xiaomi-Robotics-1: 새로운 로보틱스 모델 출시
요약
Xiaomi-Robotics-1은 10만 시간 이상의 조작 데이터를 학습한 로봇 파운데이션 모델입니다. VLM과 DiT를 결합한 2단계 학습 패러다임을 통해 미지의 환경에서도 효율적인 모바일 조작과 작업 적응력을 보여줍니다.
핵심 포인트
- 10만 시간 이상의 실제 환경 조작 궤적 학습
- 시각-언어-행동(VLA) 기반의 로봇 파운데이션 모델
- 사전 학습과 사후 학습을 통한 2단계 학습 패러다임 적용
- VLM과 Diffusion-Transformer(DiT)의 결합 구조
Xiaomi-Robotics-1은 10만 시간 이상의 실제 환경 조작 궤적 (manipulation trajectories)을 통해 학습된 로봇 파운데이션 모델 (robot foundation model)입니다. 이는 미지의 환경에서 즉각적인 모바일 조작 (mobile manipulation)이 가능하고 새로운 작업에 효율적으로 적응할 수 있도록 설계된 시각-언어-행동 (Vision-Language-Action, VLA) 모델입니다. XR-1은 대규모 언어 모델 (Large Language Models, LLM)에서 영감을 받은 2단계 학습 패러다임을 따릅니다. 즉, 광범위한 학습을 위한 사전 학습 (pre-training)과 정렬 (alignment)을 위한 사후 학습 (post-training) 단계로 구성됩니다. 이는 사전 학습의 스케일링 법칙 (scaling behavior)이 사후 학습을 통해 실제 로봇 성능으로 안정적으로 전이되며, 포화 (saturation)의 징후가 없음을 보여줍니다. XR-1은 사전 학습된 VLM (Qwen3-VL)을 Mixture-of-Transformers (MoT)를 통해 Diffusion-Transformer (DiT)와 결합합니다. DiT는 VLM과 레이어 수 (layer count)는 동일하게 맞추되, 더 빠른 추론 (inference)을 위해 더 작은 은닉층 크기 (hidden size)를 사용합니다.
HuggingFace: https://huggingface.co/collections/XiaomiRobotics/xiaomi-robotics-1
GitHub: https://github.com/XiaomiRobotics/Xiaomi-Robotics-1
Paper: https://arxiv.org/abs/2607.15330
submitted by /u/121507090301 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기