
Xiaomi, 4가지 Embodied Task를 통합하는 38B Robotics-U0 오픈 소스 공개
요약
Xiaomi가 4가지 체화된 작업(Embodied Task)을 단일 Transformer 아키텍처로 통합한 38B 규모의 Robotics-U0 모델을 오픈 소스로 공개했습니다. 이 모델은 장면 생성, 비디오 생성, 텍스트-이미지 변환 등을 하나의 모델에서 처리하는 최초의 통합 생성 모델입니다.
핵심 포인트
- 38B 파라미터 규모의 단일 Transformer 아키텍처 사용
- 장면 생성, Embodied Transfer, 비디오, Text-to-Image 통합 처리
- 작업 간 지식 전이를 통한 성능 향상 가능성 제시
- 가중치 및 추론 코드가 GitHub를 통해 오픈 소스로 공개됨
Xiaomi는 단일 모델 내에서 4가지 Embodied Task(체화된 작업)를 통합하는 38B 파라미터 Robotics-U0를 오픈 소스로 공개했습니다. 아직 벤치마크나 학습 데이터는 공개되지 않았습니다.
Xiaomi는 2026년 7월, 38B 파라미터 규모의 Embodied Generative Model(체화된 생성 모델)인 Robotics-U0를 오픈 소스로 공개했습니다. 이는 장면 생성(Scene Generation), Embodied Transfer(체화된 전이), 비디오 생성(Video Generation), 그리고 로보틱스를 위한 Text-to-Image(텍스트-이미지 변환)를 처리하는 최초의 통합 아키텍처입니다.
주요 사실
- 단일 Transformer(트랜스포머) 아키텍처 내 380억 개의 파라미터.
- 장면 생성, Embodied Transfer, 비디오, Text-to-Image 통합.
- 2026년 7월 GitHub를 통해 오픈 소스 출시.
- 벤치마크 결과나 학습 컴퓨팅 자원은 공개되지 않음.
- 최초의 오픈 소스 통합 Embodied Generative Model.
Xiaomi는 380억 개의 파라미터를 가진 Embodied Generative Model인 Robotics-U0를 오픈 소스 소프트웨어로 출시했습니다 [Pandaily에 따르면]. 이 모델은 장면 생성, Embodied Transfer, 비디오 생성, Text-to-Image라는 네 가지 서로 다른 로봇 관련 작업을 단일 Transformer 기반 아키텍처 내에서 통합한 최초의 모델이라고 주장합니다.
핵심 요약
- Xiaomi는 4가지 Embodied Task를 단일 모델로 통합한 38B 파라미터 Robotics-U0를 오픈 소스로 공개했습니다.
- 아직 벤치마크나 학습 데이터는 공개되지 않았습니다.
통합 아키텍처, 단일 모델

각 작업마다 별도의 모델이 필요했던 이전 연구들(예: 로봇 제어를 위한 RT-2, 비디오 생성을 위한 VideoPoet, 장면 생성을 위한 SceneDreamer 등)과 달리, Robotics-U0는 단일 38B 파라미터 Transformer를 사용합니다. 이 모델은 시각 및 텍스트 입력을 모두 처리하며 네 가지 작업 모두에 대해 픽셀 수준의 예측값을 출력합니다. Xiaomi는 이러한 통합된 접근 방식이 작업 간 지식 전이(Cross-task knowledge transfer)를 가능하게 하여, 개별적으로 분리된 모델들과 비교했을 때 각 작업의 성능을 잠재적으로 향상시킬 수 있다고 주장합니다.
오픈 소스 공개 및 시사점
이 모델은 오픈 소스 라이선스(open-source license) 하에 공개되었으며, 가중치(weights)와 추론(inference) 코드는 GitHub에서 확인할 수 있습니다. Xiaomi는 [발표 내용에 따라] 훈련 컴퓨팅 요구 사항, 데이터셋 크기 또는 추론 지연 시간(inference latency)을 공개하지 않았습니다. 이는 폐쇄된 상태로 유지되는 Google의 RT-2나 Meta의 Habitat와 같은 독점적인(proprietary) Embodied 모델들과 대조됩니다. 이번 오픈 소스 공개는 연구 커뮤니티를 대상으로 하며, Embodied AI 개발을 가속화하는 것을 목표로 합니다.
제공되지 않은 벤치마크 결과

Xiaomi는 Robotics-U0를 작업별 베이스라인(task-specific baselines)과 비교한 벤치마크 결과를 공개하지 않았습니다. 장면 생성 FID 점수(scene generation FID scores), Embodied 전이 성공률(embodied transfer success rates), 또는 비디오 생성 FVD와 같은 정량적 평가(quantitative evaluations) 없이는, 통합된 아키텍처가 작업별 성능을 희생시키는지 여부를 판단하기 어렵습니다. 회사는 "종합적인 벤치마크는 후속 기술 보고서에서 공개될 것"이라고 밝혔으나, 구체적인 일정은 제시되지 않았습니다.
이것이 Embodied AI에 의미하는 바
Robotics-U0는 Embodied AI 모델들이 점점 더 거대해지고 멀티모달(multimodal)화되는 환경에 진입하고 있습니다. 38B의 파라미터(parameter) 수는 Meta의 SAM 2(2.4B)와 Google의 Gemini Robotics(추정 >50B) 사이의 위치를 차지합니다. 오픈 소스로 공개함으로써, Xiaomi는 개방형 Embodied AI 생태계의 기여자로서 입지를 다지고 있으며, 이는 막대한 컴퓨팅 예산이 없는 로보틱스 연구소들의 진입 장벽을 잠재적으로 낮출 수 있습니다. 그러나 훈련 데이터에 대한 세부 정보나 벤치마크 점수가 없기 때문에, 모델의 실질적인 유용성은 아직 검증되지 않은 상태입니다.
주목해야 할 점
Xiaomi의 벤치마크 결과가 포함된 후속 기술 보고서를 주목하십시오. 만약 이 모델이 특정 작업 전용 베이스라인 (task-specific baselines)에 대해 경쟁력 있는 FID/FVD 점수를 달성한다면, 이 통합적 접근 방식(unified approach)의 유효성을 입증할 수 있을 것입니다. 그렇지 않다면, 이번 오픈 소스 공개는 실제 생산용 로보틱스 (production robotics)에 실질적으로 유용하기보다는 상징적인 의미에 그칠 수 있습니다.
출처: pandaily.com
원문 게시: gentic.news
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기