
Sim2Policy: Nebius Serverless AI를 활용한 로봇 보행 훈련
요약
Nebius Serverless AI를 활용하여 브라우저에서 로봇 보행 정책을 훈련하고 시각화하는 Sim2Policy 프로젝트를 소개합니다. 서버리스 GPU 환경에서 훈련된 체크포인트, 롤아웃 비디오, 평가 지표를 자동으로 생성하고 관리하는 아키텍처를 구현했습니다.
핵심 포인트
- Nebius Serverless AI를 이용한 로봇 정책 훈련 자동화
- 훈련 결과물(체크포인트, 비디오, 지표)의 지속 가능성 확보
- CPU 및 GPU 병렬 경로를 통한 다양한 로봇 모델 지원
- 사용자 친화적인 브라우저 기반 인터페이스 제공
저는 브라우저에 **"로봇 훈련하기(train a robot)"**라는 버튼을 만들고, 이를 Nebius Serverless AI에 연결하여 걷는 로봇, 롤아웃(rollout) 비디오, 그리고 다운로드 가능한 정책(policies)을 얻어냈습니다.
이것이 바로 Nebius Serverless Challenge 2026에 제출하는 저의 프로젝트, Sim2Policy입니다.
저장소: https://github.com/andygolubev/nebius-serverless-challenge-2026 (MIT).
사이트: https://sim-policy-trainer-challenge.info (현재 심사 기간 동안에는 @nebius.com 이메일 주소를 가진 사용자만 접속할 수 있습니다.)
아이디어 (The idea)
클라우드에서 로봇 정책(robot policy)을 훈련하는 것은 쉽습니다. 하지만 머신이 사라진 후에 그 증거를 유지하는 것은 어렵습니다. 서버리스 GPU 작업(Serverless GPU jobs)은 실행되어 훈련한 뒤 사라지며, 보통 그 증거도 함께 가져가 버립니다.
Sim2Policy는 이 문제를 해결합니다. 각 실행은 제한된 Serverless AI 작업(Serverless AI Job)에서 정책을 훈련하고, 지속 가능하며 재현 가능한 결과를 남깁니다. 사용자는 GPU, 이미지, 또는 설정 파일(config file)을 전혀 만질 필요가 없습니다. 그저 예시를 선택하고 로봇이 학습하는 것을 지켜보기만 하면 됩니다.
모든 실행은 다음을 남깁니다:
- 훈련된 체크포인트 (A trained checkpoint) — 작업이 종료되기 전에 저장된 정책(policy).
- 롤아웃 비디오 (A rollout video) — 로봇이 비틀거리던 상태에서 걷는 상태로 변하는 과정.
- 평가 지표 (Evaluation metrics) — 보상(reward), 에피소드 길이(episode length), 실행 시간(runtime), 그리고 비용(cost).
- 다운로드 가능한 정책 번들 (A downloadable policy bundle) — 체크포인트, 설정(config), 버전, 그리고 체크섬(checksums)이 하나의 파일로 포함됨.
내부적으로는 동일한 단순한 버튼 뒤에 두 가지 훈련 엔진이 작동합니다. 클래식 제어 로봇을 위한 신뢰할 수 있는 CPU 경로와, 대형 4족 보행 로봇(quadruped) 및 휴머노이드(humanoid)를 위한 GPU 병렬(GPU-parallel) 경로가 있습니다. 사용자는 어떤 것이 실행되었는지 알 필요가 없습니다. 플랫폼이 알아서 선택해 줍니다.
아키텍처 (The architecture)
Nebius 클라우드 내의 상시 가동되는 작은 VM이 앱을 실행하고 일회성 훈련 작업(disposable training jobs)을 시작합니다. 사용자는 브라우저에 머물러 있기만 하면 됩니다. 나머지는 클라우드가 처리합니다.

예시를 선택하고 시작하기
호스팅된 갤러리는 CPU 기반의 클래식한 MuJoCo 제어부터 GPU 기반의 Go1 4족 보행 로봇(quadruped) 및 G1 휴머노이드(humanoid)에 이르기까지, 즉시 실행 가능한 7가지 로봇을 제공합니다. 하나를 클릭하면 Nebius에서 실시간으로 훈련이 진행됩니다.
자신만의 로봇 가져오기
자신만의 로봇 모델을 업로드하고, 작업(task)과 장면(scene)을 결합하여 훈련할 수도 있습니다. 이 모든 과정은 가드레일(guardrails) 내에서 코드 없이 이루어집니다.

결과
실행이 완료되면 전체 결과 페이지를 받게 됩니다. 여기에는 라이프사이클(lifecycle), 주요 수치, 로봇이 움직임을 배우는 과정이 담긴 진행 비디오, 그리고 클릭 한 번으로 다운로드 가능한 **정책 번들(policy bundle)**이 포함됩니다.

그리고 저를 미소 짓게 만든 핵심 수치는 다음과 같습니다. 플래그십 모델인 Go1 실행 건은 Nebius H100에서 엔드 투 엔드(end-to-end)로 훈련되었으며, 약 10분 만에 1억 240만 스텝을 수행하는 데 비용이 약 0.52달러밖에 들지 않았습니다. CPU 예시들은 각각 약 0.02달러의 비용이 들었습니다. 이것은 커피 한 잔 값으로 누리는 진짜 GPU 강화학습 (RL)입니다.
배후에서는 이 모든 것이 그저 Nebius 작업(jobs)일 뿐입니다. 콘솔에서 H100, L40S, 그리고 CPU 사양에서 나란히 실행되는 모습을 지켜볼 수 있습니다:

세부 정보는 다음에서 확인할 수 있습니다:
지표(metrics)는 다음에서 확인할 수 있습니다:

로그(logs)는 다음에서 확인할 수 있습니다:
내부 구조 (Under the hood)
궁금한 분들을 위해 스택은 다음과 같습니다:
- 시뮬레이션: Gymnasium을 통한 MuJoCo, 그리고 GPU 병렬 물리 연산을 위한 MuJoCo Playground / MJX on JAX.
- 학습: 클래식 로봇의 경우 CPU 기반 Stable-Baselines3의 PPO, Go1 및 G1의 경우 GPU 기반 Brax PPO를 사용합니다.
- 하드웨어: JAX 경로에는 NVIDIA H100 및 L40S GPU가, 클래식 제어에는 CPU 사양이 사용됩니다. 각 작업은 적절한 것을 자동으로 선택합니다.
- 플랫폼: 단일 노드 k3s VM에 배포된 FastAPI + React 앱으로, ArgoCD를 통해 배포되며, 모든 것이 Nebius에서 OpenTofu로 프로비저닝됩니다.
설정 가능한 항목: robot/example과 선택 사항인 **random seed (랜덤 시드)**를 선택할 수 있습니다. 본인만의 로봇을 가져올 수도 있으며, locomotion task (보행 작업) (제자리 균형 잡기 또는 전진 걷기), scene preset (장면 프리셋) (평지 아레나, 경사로, 허들, 계단), 그리고 몇 가지 장면 오브젝트를 선택할 수 있습니다. 백엔드, 이미지, GPU 및 명령어는 고정되어 있습니다. 즉, 사용자는 선택권을 갖되 실수로 시스템을 망가뜨릴 위험(footguns)은 없습니다.
작동 원리
모든 것은 Nebius Serverless AI Jobs에서 실행됩니다. 사용자는 폭발적인 컴퓨팅 자원(burst of compute)에 대해서만 비용을 지불하며 그 외에는 비용이 발생하지 않습니다. 앱은 GitOps를 통해 배포되는 단일 소형 VM에서 서비스되며, 비밀 정보(secrets)는 Git 외부에서 관리됩니다. 무거운 작업(heavy lifting)은 완전히 서버리스(serverless) 방식이며, 완전히 일회성(disposable)이고, 완전히 재현 가능(reproducible)합니다.
README에는 설정, 하드웨어, 예상 출력 및 비용에 대한 내용이 포함되어 있습니다. 위에 보이는 모든 내용은 리포지토리에 있습니다:
https://github.com/andygolubev/nebius-serverless-challenge-2026
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기

