물리적 제어와 추론의 분리: DeepMind의 Gemini Robotics 2 아키텍처
요약
Google DeepMind가 추론과 물리적 제어를 분리한 Gemini Robotics 2 아키텍처를 공개했습니다. 단일 네트워크 대신 고수준 추론, 전신 VLA 제어, 온디바이스 적응의 세 가지 전문화된 모델로 나누어 효율성을 극대화했습니다.
핵심 포인트
- 추론(Context)과 제어(Latency) 사이의 트레이드오프 해결
- ER 2를 통한 고수준의 체화된 추론 및 작업 분해
- Gemini Robotics 2를 통한 전신 시각-언어-행동(VLA) 제어
- 모듈형 아키텍처를 통한 인지-계획-제어 스택 최적화
왜 추론을 모터 제어로부터 분리해야 하는가
범용 로봇은 동시에 매우 다른 두 가지 작업을 수행해야 합니다. 로봇은 어지럽고 가득 찬 방의 시각적 장면을 읽고, 수 분 단위의 계획을 메모리에 유지하며, 사람과 대화해야 합니다. 동시에, 균형을 잡는 휴머노이드를 똑바로 세우고 들고 있는 물건을 떨어뜨리지 않고 섬세한 손을 움직이게 하는 고주파 제어 루프 (high-frequency control loop)를 닫아야 합니다. 이 두 작업을 하나의 엔드 투 엔드 (end-to-end) 네트워크에 밀어 넣는 것은 불편한 트레이드오프 (trade-off)를 강요합니다. 즉, 추론을 위해 원하는 큰 컨텍스트 윈도우 (context window)가 토크 제어 (torque control)에 필요한 낮은 지연 시간 (low latency)과 충돌하게 됩니다.
2026년 7월 28일, Google DeepMind는 Gemini Robotics 2를 통해 해당 트레이드오프에 정면으로 맞섰으며, 7월 30일에는 Gemini Robotics ER 2를 선보였습니다. 이 제품군은 하나의 거대한 단일 네트워크 (monolithic network) 대신, 문제를 세 가지 전문화된 모델로 나눕니다. 즉, 전신 시각-언어-행동 (whole-body vision-language-action, VLA) 제어, 고수준의 체화된 추론 (high-level embodied reasoning), 그리고 온디바이스 적응 (on-device adaptation)으로 분리하며, 각 모델은 서로 다른 속도와 컨텍스트 크기에 맞춰 조정되었습니다. 이러한 모듈형 사고 방식은 arXiv robotics listings와 Hugging Face Papers에 수집된 최근의 로보틱스 및 VLA 연구 전반에서도 확인할 수 있으며, 여기서 분해된 인지-계획-제어 (perception-planning-control) 스택은 반복적인 패턴이 되었습니다. DeepMind의 구체적인 분리 방식을 이해하면 왜 이 아키텍처가 인기를 얻고 있는지 명확해집니다.
세 가지 모델 분리
ER 2: 고수준 작업 추론 (High-Level Task Reasoning)
Gemini Robotics ER 2는 스택의 인지적 플래너 (cognitive planner)입니다. 이는 체화된 추론 (embodied reasoning)을 위해 구축된 시각-언어 모델 (vision-language model)입니다. 실시간 카메라 피드와 자연어 지시 사항을 입력받아, 수 분 동안 실행될 수 있는 작업을 구조화된 하위 목표 (sub-goals)로 분해합니다. 계획 수립을 넘어, ER 2는 인간 감독자와의 대화를 관리하고, 공간적 맥락을 해석하며, 공유 작업 공간에서 작동하는 여러 로봇을 조정합니다. 즉, 어떤 하위 작업이 어떤 플랫폼에 할당될지를 결정합니다.
제어 계층 (control layer)보다 느린 속도(초당 대략 몇 회)로 작동하는 ER 2는 빈도(frequency)를 희생하는 대신 맥락의 폭을 확보합니다. 이러한 분리는 매우 중요합니다. 추론 모델은 100 Hz의 균형 제어 (balance-control) 경로와 같은 임계 경로에 있지 않기 때문에, 넓은 컨텍스트 윈도우 (context window)를 실행하고 신중한 순전파 (forward pass)를 수행할 여유가 있습니다.
Gemini Robotics 2: 전신 VLA 컨트롤러 (Whole-Body VLA Controller)
ER 2가 무엇을 할지 결정한다면, Gemini Robotics 2는 하드웨어가 어떻게 움직일지를 결정합니다. 시각-언어-행동 (VLA) 모델로서, 이 모델은 양팔 매니퓰레이터 (bi-arm manipulators)와 발끝부터 손가락 끝까지의 전체 휴머노이드 신체에 대한 모터 제어를 구동합니다.
이 모델은 동적 균형 (dynamic balance)과 미세 조작 (fine manipulation)을 통합합니다. 웅크리기, 걷기, 복잡한 공간 탐색과 같은 전신 동작을 위한 궤적 (trajectories)을 생성합니다. 물리적 상호작용을 위해 다양한 말단 장치 (end-effectors)를 제어합니다. 매듭 묶기와 같은 섬세한 작업을 위한 22자유도 (DoF) 다섯 손가락 손과, 정밀한 포장 및 배치를 위한 두 손가락 그리퍼 (grippers)를 모두 포함합니다.
On-Device 2: 신속한 체화 적응 (Rapid Embodiment Adaptation)
에지 (edge)에서 작동하는 Gemini Robotics On-Device 2는 로봇 하드웨어에서 직접 로컬 실행이 가능하도록 최적화된 효율적인 VLA 변형 모델입니다. 이 모델의 역할은 저지연 폐루프 제어 (low-latency closed-loop control) 및 하드웨어 변동에 대한 조정이며, 이는 로봇별 운동학적 특이성 (kinematic quirks)에 가장 민감한 문제 영역입니다.
DeepMind의 보고에 따르면, On-Device 2는 단 몇 시간의 운영 데이터와 200개 미만의 시연 (demonstration) 예시만으로 새로운 로봇 구현체 (embodiment)에 적응할 수 있습니다. 이러한 로우샷 (low-shot) 능력은 물리적 AI (physical AI)의 실제 병목 구간을 겨냥합니다. 즉, 새로운 형태 (morphology)가 나타날 때마다 방대한 시연 데이터셋을 수집하지 않고도, 미세 제어 정책 (fine control policies)을 새로운 운동학 (kinematics)에 맞춰 재타겟팅 (retargeting)하는 문제입니다.
실행 루프 (The Execution Loop)
물리적 목표를 달성하려면 세 가지 계층 전체에 걸쳐 연속적인 핸드오프 (handoff)가 필요합니다. 사용자가 휴머노이드 로봇에게 어질러진 작업 공간을 정리하고 물건을 챙기라고 지시하는 상황을 가정해 보겠습니다.
- 목표 계획 (Goal Planning) — ER 2가 카메라 스트림을 읽고, 장면을 분석하며, 수 분이 소요되는 작업을 개별적인 하위 목표 (sub-goals)로 분해하여 할당합니다.
- 액션 디스패치 (Action Dispatch) — ER 2가 구조화된 의도 타겟 (intent targets)을 Gemini Robotics 2로 전달합니다.
- 궤적 생성 (Trajectory Generation) — Gemini Robotics 2가 하위 목표를 조율된 관절 제어 (joint control)로 변환하며, 보행 안정성과 매니퓰레이터 (manipulator) 위치 선정 사이의 균형을 맞춥니다.
- 로컬 실행 (Local Execution) — On-Device 2가 엣지 하드웨어 (edge hardware)에서 폐루프 제어 (closed-loop control)를 실행하며, 표면 마찰과 미세 지연 (micro-delays)을 실시간으로 보정합니다.
해당 루프에 대한 개념적 의사코드 (pseudocode)는 다음과 같습니다:
# 개념적 예시: Gemini Robotics 2 오케스트레이션 루프
class GeminiRoboticsOrchestrator:
...
이는 참조용 구현체가 아닌 예시일 뿐이지만, 핵심 아이디어는 명확합니다. 각 모델이 하나의 계층을 담당하며, 오케스트레이터 (orchestrator)는 의도를 아래로 전달하고 센서 데이터를 위로 전달할 뿐입니다.
안전성: ASIMOV-Agentic 벤치마크
물리적 환경은 명시적인 안전 검증을 요구하므로, DeepMind는 물리적 모호성 (physical ambiguity) 상황에서 에이전트의 행동을 평가하기 위해 ASIMOV-Agentic 벤치마크를 도입했습니다. 이 벤치마크는 세 가지 능력을 측정합니다:
- 불확실성 처리 (Uncertainty handling) — 센서 데이터나 환경 신호가 안전한 실행을 수행하기에 너무 약할 때 이를 인식하는 능력.
- 안전하지 않은 도구 호출 거부 (Unsafe tool-call refusal) — 기계적 한계를 초과하거나 충돌 위험이 있는 동작 요청을 거부하는 능력.
- 인간 에스컬레이션 (Human escalation) — 작업의 안전성이 모호할 때 일시 중지하고 인간의 확인을 요청하는 능력.
런타임(Runtime) 시, ER 2는 능동적인 안전 제약 조건(active safety constraints)을 강제합니다. 인간이 존재할 경우 실시간으로 이를 감지하고 자동 비상 정지를 트리거할 수 있습니다. 이는 단순히 프롬프트 수준(prompt level)에서만 이루어지는 것이 아니라, 제어 계층(control layer)에서 결정론적으로(deterministically) 강제되는 안전 기능입니다. 모델이 물리적 하드웨어를 구동할 수 있는 상황에서는 이러한 차이가 매우 중요합니다.
실제 사용 가능한 기능
플랫폼을 평가하는 개발자는 출시 발표 내용과 공개 접근 권한을 구분해야 합니다:
- Gemini Robotics ER 2 — Google AI Studio를 통해 이용 가능하며, Gemini Enterprise Agent Platform에서 프라이빗 프리뷰(private preview)로 제공됩니다.
- Gemini Robotics 2 및 On-Device 2 — 얼리 액세스(early-access) 파트너에게만 접근 권한이 있으며, 일반 대중에게는 공개되지 않았습니다.
- 안전 방법론 (Safety methodology) — DeepMind의 _Gemini Robotics 2 Safety Technical Report_에 문서화되어 있습니다.
적은 수의 데이터로 적응하는 로우샷 적응(low-shot adaptation) 주장(몇 시간 내에 200회 미만의 시연)은 주목할 만하지만, 다양한 제3자 하드웨어에 걸친 독립적인 검증을 위해서는 더 광범위한 배포가 필요할 것입니다. 현재로서는 특정 가중치(weights)보다는 아키텍처 패턴이 더 즉각적으로 실행 가능한 가치를 제공합니다.
로보틱스 빌더를 위한 시사점
- 의미론적 계획(semantic planning)과 제어 속도(control rate)를 분리하십시오. 고수준 VLM(Vision-Language Models)은 비동기식 플래너(asynchronous planners, 약 1–5 Hz)로서 작동할 때 가장 효율적이며, 빠른 모터 균형 잡기는 100 Hz 이상으로 실행되는 전용 저지연 컨트롤러(low-latency controllers)에 맡겨야 합니다.
- 거부 로직(refusal logic)을 제어 계층에 배치하십시오. ASIMOV-Agentic이 제안하듯이, 안전은 단순히 프롬프트 수준의 지침이 아니라 액추에이터(actuators)가 구동되는 지점에서 결정론적인 거부 메커니즘을 갖춰야 합니다.
- 하드웨어 경계(hardware seam) 뒤로 운동학(kinematics)을 추상화하십시오. 일반적인 전신 제어(whole-body control)를 로컬 온디바이스 미세 조정(on-device fine-tuning)과 분리하면, 새로운 손이나 다리 구성에 정책(policy)을 이식하기가 훨씬 쉬워집니다.
장기적 추론(long-horizon reasoning), 전신 모터 제어(whole-body motor control), 그리고 로컬 하드웨어 튜닝을 별개의 모델로 분리함으로써, Gemini Robotics 2는 하나의 네트워크가 모든 것을 한꺼번에 수행하도록 강요하지 않고도 로봇의 형태(morphologies)에 관계없이 적응할 수 있는 물리적 AI 구축을 위한 실행 가능한 청사진을 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기