Gemini Robotics ER 2: 비디오 이해, 작업 오케스트레이션 및 다중 로봇 협업으로 로보틱스에 동력을 공급하다
요약
Gemini Robotics ER 2는 로봇을 위한 고수준의 '체화된 추론(embodied reasoning)' 모델로, 복잡한 다단계 작업을 계획하고 물리적 세계를 이해하는 능력을 제공합니다. 이 모델은 비디오 관찰을 통해 진행 상황을 추적하고 오류에 적응하며, Google Search 같은 외부 도구 호출 및 다중 로봇 협업까지 가능하게 합니다.
핵심 포인트
- 로봇의 고수준 두뇌 역할을 수행하는 '체화된 추론' 모델입니다.
- 비디오 피드 관찰을 통해 진행 상황 추적 및 오류 적응 능력이 향상되었습니다.
- 다중 로봇 협업 기능을 도입하여 복잡한 워크플로우를 처리합니다.
- 외부 도구 호출(Google Search 등)과 VLA 모델을 통합하는 오케스트레이션이 가능합니다.
Gemini Robotics ER 2 소개

로봇이 일상 환경에서 인간을 보조하려면 정확한 공간 추론만으로는 충분하지 않습니다. 로봇은 또한 빠르게 생각하고, 물리적 세계의 실시간 속도에 맞춰 결정과 추론을 해야 합니다.
그렇기 때문에 오늘 저희는 로보틱스를 위한 가장 강력한 '체화된 추론(embodied reasoning)' 모델인 Gemini Robotics ER 2를 출시합니다. Gemini Robotics ER 2를 로봇을 위한 고수준의 두뇌라고 생각하시면 됩니다. 이 모델은 로봇이 인간과 대화하고, 물리적 세계를 이해하며, 다단계 작업을 계획할 수 있도록 합니다. 그런 다음 모터 실행은 주어진 하위 레벨 비전-언어-행동(VLA) 모델에 위임합니다. Gemini Robotics ER 2는 또한 Google Search와 같은 도구를 찾거나 다른 사용자 정의 함수를 호출할 수 있습니다. Gemini Robotics ER 2의 설계는 로봇이 행동을 수행하는 동시에 다음에 무엇이 올지 '생각'할 수 있도록 합니다.
Gemini Robotics ER 2는 Gemini Robotics ER 1.6 대비 상당한 업그레이드를 보여줍니다. 연속적인 비디오 피드를 관찰함으로써, 로봇은 이제 자신의 진행 상황을 추적하고, 무언가 잘못되면 적응하며, 다음 단계로 언제 이동해야 하는지 정확히 알 수 있습니다. 또한 다중 로봇 협업 기능을 도입하여, 로봇들이 공유 공간에서 함께 작업하고 단일 로봇이 혼자 할 수 없는 복잡한 워크플로우를 완료할 수 있게 합니다.
Gemini Robotics ER 2는 현재 Gemini API, Google AI Studio 및 Gemini Enterprise Agent Platform의 비공개 미리보기를 통해 개발자에게 공개적으로 제공됩니다. 시작하는 데 도움을 드리기 위해, 모델 구성 방법과 더 유용한 물리적 AI 작업을 구동하기 위한 프롬프트 예시를 공유합니다.
물리적 에이전트 역량 발전
물리적 세계의 대부분의 작업은 복잡하며 완료하는 데 여러 단계가 필요합니다. Gemini Robotics ER 2는 물리적 에이전트로서 로봇을 위한 단계를 오케스트레이션하고, 스스로 오류를 수정하며(self-correct), 더 새로운 상황에 일반화할 수 있도록 지원합니다. 에이전트 기반 설정을 구축하기 위해 개발자는 Vision-Language-Action (VLA) 모델이나 내비게이션 API와 같은 저수준 제어 인터페이스를 도구로 선언하고, 멀티모달 비디오, 오디오 또는 텍스트를 모델에 직접 스트리밍할 수 있습니다.
Gemini Robotics ER 2는 이러한 도구 오케스트레이션 워크플로우를 개선합니다. 우리는 시뮬레이션의 로봇을 사용하거나, 실제 로봇 제어를 이용하거나, 심지어 원격으로 로봇을 조종하는 인간과 페어로 연결하여 그 성능을 평가할 수 있습니다.
Gemini Robotics ER 2는 세 가지 제어 모드(실제 VLA, 시뮬레이션 VLA, 인간 원격 조작) 전반에 걸쳐 도구 오케스트레이션 측면에서 ER 1.6보다 일관되게 우수한 성능을 보입니다.

로보틱스에서 고수준 추론은 실행 속도에 달려 있습니다. Gemini Robotics ER 2는 지연 시간에 민감한 작업에 최적화된 양방향 스트리밍 엔드포인트를 사용하여 Gemini Live API에 통합됩니다. 그 결과, 매끄러운 오케스트레이션이 가능해집니다: Gemini Robotics ER 2가 액션 모델과 로보틱스 API를 명령하여 '멈추고 생각하는' 듯한 끊김 없이 다단계 작업을 완료합니다.
이를 설명하기 위해, 우리는 파트너사인 Boston Dynamics의 Spot을 활용한 데모를 구축했습니다. 우리는 Gemini Robotics ER 2를 사용하여 내비게이션 및 매니퓰레이터 움직임과 같은 Spot API를 오케스트레이션하여, 물건을 가져다주는 상호작용적인 로봇을 만들었습니다.
Gemini Robotics ER 2가 구동하는 Boston Dynamics의 Spot이 자연어 명령에 따라 팝콘 간식을 집습니다.
코드는 다른 예제들과 함께 Github에서 이용 가능합니다.
견고한 작업 완료를 위한 시간적 지능 잠금 해제
로보틱스에서 가장 어려운 과제 중 하나는 작업이 언제 끝났는지 아는 것입니다. Gemini Robotics ER 2는 복잡한 작업(예: 전구 조이기 또는 쓰레기 봉지 묶기)이 다음 작업으로 전환되기 전에 사양에 맞게 완료되었는지 확인하는 비디오 이해 및 진행 상황 추적 분야에 큰 발전을 가져옵니다.
이번 업데이트에서는 작업 진행 이해를 위한 두 가지 핵심 기능, 즉 진행 상황 분류(progress classification)와 순간 포착(moment finding)에 진전을 이루었습니다.
연속적인 진행 상황 분류 (Continuous progress classification)
진행 상황 분류는 로봇이 작업 완료까지의 진행 정도를 추적하는 능력을 의미합니다. 저희 평가에서 비디오 피드의 각 프레임을 다섯 단계의 진행률(0-20%, 20-40%, 40-60%, 60-80%, 80-100%)로 분류합니다. 작업 진행 정도를 정량화함으로써, Gemini Robotics ER 2는 로봇에게 실시간 상황 인지 능력을 제공하며, 전체 워크플로우를 재시작하지 않고도 즉각적으로 행동을 조정하거나 실패한 단계를 다시 시도할 수 있게 합니다.
Gemini Robotics ER 2는 진행 상황 분류 작업에서 57.4%의 정확도를 달성하여 이전 세대 모델과 경쟁하는 최첨단 모델들을 능가했습니다.

정밀한 순간 포착 (Precision moment-finding)
순간 포착은 모델이 중요한 이벤트가 발생하는 정확한 비디오 프레임을 식별하는 능력을 측정합니다(예: 컵에 커피를 붓는 것을 언제 멈춰야 하는지). Gemini Robotics ER 2는 순간 포착 성능에서 상당한 향상을 이루어, 로봇이 작업 간에 정밀하게 전환하고 성공 여부를 확인하며 수정 사항을 제안할 수 있도록 합니다.
순간 포착 작업을 위해 Gemini Robotics ER 2는 91.3%의 정확도와 0.96초의 평균 절대 거리를 달성했습니다. 이는 훨씬 더 큰 모델 범주들과 근접하게 경쟁하는 수준이지만, 계산 비용은 그 일부에 불과하고 실행 속도는 4배나 빠릅니다. 이 서브-세컨드 지연 시간(sub-second latency)은 실제 환경에서 물리적 로봇을 안전하게 작동시키는 데 실제로 필요한 수치입니다.

다중 로봇 협업 (Multi-robot collaboration)
어떤 단일 로봇도 모든 작업에 적합하지 않습니다. 바퀴 달린 로버는 실내에서 탁월한 성능을 보이지만, 휴머노이드 로봇은 불규칙한 지형에서 뛰어날 수 있습니다. Gemini Robotics 2는 다중 로봇 협업을 가능하게 하여, 다양한 기계들이 공유된 의미론적 이해(shared semantic understanding)를 통해 통신하며 복잡한 작업을 인계하고 완료할 수 있도록 합니다. Apptronik의 Apollo 2와 Franka F3 Duo가 어떻게 협력하는지 여기서 확인해 보세요.
일반적인 공간 지능 향상
일반적인 공간 지능 향상
Gemini Robotics ER 2는 세 가지 벤치마크를 통해 측정되는 핵심 공간 추론(spatial reasoning) 능력을 발전시켰습니다:
성공/실패 감지: 이제 정적 스냅샷이 아닌 원본 비디오 피드를 기반으로 작동하여, 유출, 미끄러짐 또는 정렬 불량과 같은 실행 중 실패를 포착합니다.일반 기기 판독: 원형 다이얼이나 사이트 글라스(sight glasses)를 넘어 디지털 디스플레이, 선형 스케일, 자, 액체 온도계까지 포함하도록 확장되었습니다. 저희는 이를 10가지 다른 유형의 기기에 걸쳐 테스트했습니다.향상된 공간 VQA: Gemini가 발전시킨 멀티모달 이해(multi-modal understanding)를 통해 시각적 질의응답(Visual Question Answering, VQA)을 개선합니다.
Gemini Robotics ER 2는 성공 감지(이미지/비디오), 질문 응답(ERQA), 일반 기기 판독 등 모든 핵심 기능에서 일관되게 가장 높은 정확도를 달성했습니다.
체화된 지능을 위한 안전 발전
Gemini Robotics ER 2는 저희가 개발한 모델 중 가장 안전하며, 추론 작업 중 물리적 제약 조건 준수와 인간 감지 같은 공간 인식을 평가하는 Safety Instruction Following 및 Human Proximity 벤치마크에서 상당한 향상을 이루었습니다. 저희는 Gemini Robotics ER 2가 사람이 근처에 있을 때 휴머노이드 로봇의 작동을 성공적으로 멈추고, 해당 영역이 안전해진 후에만 자율적으로 작업을 재개하는 것을 발견했습니다. 물리적 에이전트의 안전성을 발전시키기 위해, 저희는 기초 모델(foundation model)이 안전한 VLA 오케스트레이터(orchestrator) 역할을 할 수 있는 능력을 평가하는 벤치마크를 도입합니다. 이는 안전 제약 조건 강제, 환경 모니터링, 물리적 실현 가능성 평가 및 인간의 명확화 요청 능력 테스트를 포함합니다. 자세한 내용은 저희의 안전 기술 보고서를 참조하십시오.
Gemini Robotics ER 2는 Safety Instruction Following 및 Human Proximity 벤치마크에서 ER 1.6 및 다른 최첨단 모델들을 능가합니다.
앞으로, 저희는 이러한 모델들을 더욱 복잡한 작업으로 끌어올려 유용한 로봇의 개발을 가속화하고 로보틱스 커뮤니티를 지원할 계획입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Google DeepMind의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기