현재 로보틱스를 변화시키고 있는 5가지 AI 모델
요약
로보틱스 패러다임을 변화시키고 있는 5가지 주요 AI 모델을 소개합니다. 시각-언어-행동(VLA) 모델을 중심으로 RT-2, OpenVLA, NVIDIA GR00T, Hugging Face의 LeRobot 등 혁신적인 기술들을 다룹니다.
핵심 포인트
- VLA 모델은 시각 정보와 언어 지시를 실제 로봇 행동으로 연결함
- RT-2는 로봇 행동을 텍스트 토큰으로 표현하여 범용성을 확보함
- OpenVLA는 강력한 VLA 모델을 오픈 소스로 제공하여 접근성을 높임
- NVIDIA GR00T는 휴머노이드 로봇을 위한 범용 파운데이션 모델임
- LeRobot은 데이터셋과 시뮬레이션을 포함한 개방형 로보틱스 플랫폼임
로봇을 프로그래밍한다는 것은 과거에 모든 단계를 스크립트로 작성하는 것을 의미했습니다. 이 다섯 가지 모델이 바로 그 변화를 빠르게 이끌고 있는 이유입니다.
얼마 전까지만 해도 로봇이 작업을 수행하게 하려면 모든 단계를 프로그래밍해야 했습니다. 오늘날 로봇은 언어를 이해하고, 사물을 인식하며, 새로운 기술을 배우기 시작했습니다. 이러한 변화의 이면에 있는 로보틱스용 AI 모델은 대부분 시각-언어-행동 (Vision-Language-Action, VLA) 모델이라고 불리는 새로운 클래스로, 로봇이 보는 것과 지시 사항을 입력받아 이를 수행하기 위한 행동을 출력합니다. 변화를 주도하고 있는 다섯 가지 모델을 소개합니다.
1. RT-2: 언어를 로봇의 행동으로 연결한 모델
첫 번째는 Google DeepMind의 RT-2입니다. 2023년에 출시된 이 모델은 시각-언어-행동 (VLA) 카테고리의 이름을 명명한 모델입니다.
이 모델의 핵심 기술은 로봇의 행동을 텍스트 토큰 (text tokens)으로 표현하는 것이었습니다. 이를 통해 단일 모델이 웹 규모의 이미지 및 텍스트 데이터와 실제 로봇 데이터를 모두 학습할 수 있었습니다. 그 결과, 로봇은 자신이 보는 것과 자연어로 작성된 지시 사항을 연결할 수 있게 되었습니다. 고정된 명령을 따르는 대신, 로봇은 로봇 학습 데이터에서 본 적 없는 사물이나 표현에 대해서도 인간이 실제로 의도한 바가 무엇인지 파악하기 시작했습니다.
2. OpenVLA: 시각-언어-행동 모델을 오픈 소스로 가져오다
또 다른 주요 진전은 Stanford와 Toyota Research Institute가 개발한 70억 파라미터 (7-billion-parameter) 모델인 OpenVLA와 함께 찾아왔습니다.
이 모델의 기여는 접근성입니다. 강력한 시각-언어-행동 (VLA) 모델을 오픈 소스 세계로 가져옴으로써, 어떤 연구소나 개발자라도 가중치 (weights)를 다운로드하고, 자신의 로봇에 맞춰 미세 조정 (fine-tune)하며, 현대적인 로보틱스 AI를 실험할 수 있게 되었습니다. 이를 통해 VLA는 소수의 대규모 팀만이 탐구할 수 있는 영역에서 분야 전체가 기반으로 삼을 수 있는 영역으로 변모했습니다.
3. NVIDIA GR00T: 휴머노이드 로봇을 위한 파운데이션 모델
NVIDIA는 GR00T를 통해 다른 접근 방식을 취하고 있습니다. 하나의 작업만을 목표로 하는 대신, GR00T N1은 휴머노이드 로봇이 광범위한 일상 활동을 수행할 수 있도록 돕는 개방형 파운데이션 모델 (foundation model)로 설계되었습니다.
이 모델은 이중 시스템 설계를 사용합니다. 시각-언어 모델 (vision-language model)은 보고 듣는 것에 대한 추론을 처리하고, 별도의 액션 모듈 (action module)은 실제 모터 명령 (motor commands)을 생성합니다. 하나의 가중치 (weights) 세트로 단일 팔, 양손 (bimanual), 그리고 휴머노이드 신체를 구동할 수 있으며, 이는 휴머노이드 로봇이 실용성을 갖추기 위해 반드시 필요한 범용성 (generality) 그 자체입니다.
4. LeRobot: AI 기반 로봇을 위한 개방형 플랫폼
다음은 Hugging Face의 LeRobot입니다. 이를 단순히 모델이라고 부르는 것은 그 가치를 과소평가하는 것입니다. LeRobot은 데이터셋, 사전 학습된 모델 (pre-trained models), 시뮬레이션 환경 (simulation environments), 그리고 개발자들이 AI 기반 로봇을 더 빠르게 구축할 수 있도록 돕는 도구들을 갖춘 개방형 로보틱스 플랫폼입니다.
이 아이디어는 Hugging Face가 언어 모델 (language models)을 위해 했던 방식과 유사합니다. 데이터, 모델, 그리고 도구들을 한곳에 모아 사람들이 처음부터 시작하는 대신 검증된 작업물로부터 시작할 수 있게 하는 것입니다. 직접 탐색해보고 싶다면 LeRobot 코드베이스가 어떻게 구조화되어 있는지 자세히 살펴보았습니다.
5. Pi-Zero: 다양한 로봇과 작업을 아우르는 하나의 모델
마지막으로 Physical Intelligence의 π0(Pi-Zero)입니다. 이 모델의 목표는 야심 차게도, 서로 다른 로봇과 서로 다른 작업에 걸쳐 적응할 수 있는 단일 AI 모델을 만드는 것입니다.
이 모델은 사전 학습된 시각-언어 모델 (vision-language model)을 플로우 기반 액션 전문가 (flow-based action expert)와 결합하며, 단일 로봇이 아닌 다양한 로봇 유형의 데이터를 통해 학습합니다. 이러한 교차 신체 (cross-embodiment) 접근 방식, 즉 '많은 신체를 위한 하나의 두뇌'는 범용 로보틱스 (general-purpose robotics)를 향한 진정한 진전이며, 빨래를 접거나 테이블을 치우는 것과 같은 일상적인 작업을 수행하는 데모를 통해 그 능력이 입증되었습니다.
이러한 AI 모델들이 로보틱스의 미래에 갖는 의미
이 다섯 가지 모델은 서로 다른 접근 방식을 취하고 있지만, 모두 동일한 미래를 목표로 하고 있습니다. 로봇은 단순히 지시를 따르는 단계를 넘어, 주변 세계를 학습하고 적응하며 상호작용하는 방향으로 나아가고 있으며, 이것이 바로 체화된 AI (embodied AI)의 핵심 약속입니다.
이 모든 모델을 관통하는 하나의 흐름은 바로 규모(scale)입니다. 각 모델은 방대한 양의 학습 데이터에 의존하며, 그 중 상당 부분은 시뮬레이션 (simulation)에서 옵니다. 시뮬레이션에서는 모델이 실제 하드웨어를 만지기 전에 수백만 번의 연습을 수행할 수 있습니다.
FAQ
시각-언어-행동 (vision-language-action, VLA) 모델이란 무엇인가요?
VLA 모델은 로봇이 보는 시각 정보와 언어 지시를 함께 입력받아, 로봇의 행동을 직접 출력합니다. 이를 통해 로봇은 하드코딩된 단계를 실행하는 대신, 자연어 명령을 따르고 명시적으로 학습하지 않은 물체나 상황에도 일반화하여 대응할 수 있습니다.
RT-2는 무엇인가요?
RT-2는 Google DeepMind에서 2023년에 출시한 시각-언어-행동 (vision-language-action) 모델입니다. 이 모델은 로봇의 행동을 텍스트 토큰으로 표현하여, 단일 모델이 웹 데이터와 로봇 데이터 모두로부터 학습할 수 있게 합니다. 이를 통해 인터넷의 일반적인 지식을 물리적 제어에 적용할 수 있습니다.
가장 좋은 오픈 소스 로보틱스 AI 모델은 무엇인가요?
OpenVLA는 가중치(weights)가 공개되어 있고 제한된 데이터로도 새로운 로봇에 맞춰 미세 조정(fine-tuning)할 수 있기 때문에 흔히 시작점으로 사용됩니다. Hugging Face의 LeRobot은 데이터셋, 사전 학습된 모델(pretrained models), 그리고 이러한 모델들을 위한 도구들을 제공하는 대표적인 오픈 플랫폼입니다.
NVIDIA GR00T는 무엇인가요?
GR00T는 범용 휴머노이드 로봇을 위한 NVIDIA의 오픈 파운데이션 모델(open foundation model)입니다. 추론을 위한 시각-언어 모델(vision-language model)과 모터 제어를 위한 행동 모듈(action module)을 결합하였으며, 단일 가중치 세트로 단일 팔(single-arm), 양손(bimanual), 그리고 휴머노이드 로봇을 작동시킬 수 있습니다.
Pi-Zero (π0)란 무엇인가요?
Pi-Zero는 Physical Intelligence에서 개발한 범용 로봇 제어를 위한 시각-언어-행동 모델 (Vision-Language-Action model)입니다. 이 모델은 다양한 로봇의 데이터를 통해 학습되었으며, 하나의 모델이 서로 다른 신체 구조와 다양한 작업에 적응하는 것을 목표로 합니다.
이러한 로보틱스 AI 모델들은 어떻게 학습되고 테스트되나요?
주로 시뮬레이션 (Simulation) 환경에서 이루어지며, 이를 통해 고가의 하드웨어에서 구동하기 전에 정책 (Policy)을 대규모로 학습하고 평가할 수 있습니다. Drift와 같은 도구들은 이러한 테스트에 사용되는 시뮬레이션 로봇과 환경을 생성하며, 모델 자체는 해당 시뮬레이션 위에서 학습됩니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기