시각-언어-행동(VLA) 조작을 위한 Real2Sim2Real: AMD ROCm 기반 파이프라인
요약
AMD의 ROCm 소프트웨어 스택을 활용하여 VLA(시각-언어-행동) 모델과 체화된 에이전트를 구현하는 Real2Sim2Real 파이프라인을 제안합니다. CUDA 없이도 Radeon GPU와 Ryzen AI를 통해 로봇 조작 및 강화학습을 수행할 수 있음을 입증합니다.
핵심 포인트
- AMD ROCm 기반의 엔드 투 엔드 가속 기술 스택 제시
- CUDA 종속성 없는 VLA 모델 학습 및 배포 가능성 입증
- 3D Gaussian Splatting과 Genesis 엔진을 결합한 데이터 생성
- RDNA4 및 RDNA3.5 하드웨어에서의 네이티브 실행 확인
Physical AI — 대규모 시각-언어-행동 (VLA) 모델과 실제 세계에서 작동하는 체화된 에이전트 (embodied agents)의 통합 — 는 Jensen Huang("다음의 거대한 흐름은 Physical AI, 즉 신체를 가진 AI입니다", GTC Paris, 2025년 6월)과 Dr. Lisa Su("우리는 Physical AI의 세계로 진입하고 있습니다... 이것이 AI가 실제 세계로 들어오는 지점입니다", CES 2026)와 같은 업계 리더들이 강조했듯이 AI의 차세대 주요 개척지로 부상했습니다. 본 논문은 데이터 센터 학습용 실리콘, Radeon PRO 시뮬레이션/렌더링 GPU, 그리고 Ryzen AI 엣지 컴퓨팅을 아우르며 오픈 소스 ROCm 소프트웨어 스택으로 통합된, 체화된 조작 (embodied manipulation)을 위한 엔드 투 엔드 (end-to-end) 방식의 완전한 AMD 가속 기술 스택을 제시합니다. 우리는 VLA 기반 조작 정책을 학습하고 배포하는 데 CUDA에 종속된 생태계가 필요하지 않음을 입증합니다. 네 가지 단계별 데모가 제시됩니다: (1) SmolVLA로 학습되어 실제 Franka 로봇 팔에 배포된 Sim-to-Real 조작 파이프라인; (2) 의미론적이고 언어에 기반한 객체 선택 작업 ('one-of-three'); (3) 실제 장면의 3D Gaussian Splatting (3DGS) 재구성본을 Genesis 물리 엔진과 결합한 Real2Sim 합성 데이터 생성 파이프라인; (4) 여러 하드웨어 플랫폼에서 벤치마킹된 사족 보행 및 휴머노이드 이동성을 위한 대규모 강화학습 (RL). 모든 파이프라인은 RDNA4 (Radeon AI PRO R9700) 및 RDNA3.5 (Radeon PRO W7900) 하드웨어에서 ROCm + PyTorch 상에서 네이티브로 실행되며, 무료 Radeon Cloud Platform에서 재현 가능합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.GR (Graphics)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기