Google DeepMind Gemini Robotics 2와 범용 로봇 현황 심층 인터뷰: 로봇 올림픽, 전신 제어, 크로스-바디부터 안전
요약
Google DeepMind의 Gemini Robotics가 로봇 기술 현황을 심층 분석하며, 시뮬레이션에서 현실로 옮기는 과정(sim-to-real)의 난이도 차이를 설명합니다. 특히 조작 임무는 마찰 및 변형 예측 때문에 어려우며, 최근에는 그리퍼를 넘어 일반화 가능한 전신 조작 능력이 연구 최전선에 있음을 강조했습니다.
핵심 포인트
- 조작 임무는 마찰/변형 예측이 어려워 시뮬레이션의 한계가 명확함.
- 최근 로봇 기술은 단순 Pick-and-place를 넘어 일반화 가능한 전신 조작으로 진화 중.
- 로봇은 LLM처럼 오류를 허용하지 못하므로, 높은 성공률과 긴 임무 지속 시간이 중요함.
[
]일반적인 전체 설명:
이 팟캐스트는 일종의 '현재 로봇 기술 수준'에 대한 현실적인 보고서와 같습니다. 게스트는 Google DeepMind 소속으로 Gemini Robotics를 담당하고 있습니다. 핵심 결론은
제(3)부 시뮬레이션에서 현실로, 운동 제어 및 조작 임무의 난이도 차이 (18% - 30%)
1 Sim-to-Real 기본 논리: 로봇의 시뮬레이션 환경에서 실제 기기로 옮겨가는 'sim-to-real gap'을 설명합니다. 시뮬레이션에서 안정적으로 학습할수록 먼저 해결하기 쉽습니다. 운동 제어는 지면, 벽, 평평한 접촉 등 모델링 가능한 요소들 덕분에 시뮬레이션의 수혜를 입습니다.
2 달리기(Running)가 시뮬레이션에 적합한 이유: 지면/트랙과의 접촉이 비교적 규칙적이고, 강체이며, 전체 시스템을 모델링할 수 있습니다. 운동 모방 사전 학습을 활용하고, 이후 강화학습 (RL)으로 특정 기체에 맞춰 미세 조정하여 '더 빨리 달리기'를 목표 최적화할 수 있습니다. 만약 단순히 직선 달리기가 목적이라면 내비게이션 요소도 낮습니다.
3 조작 임무가 더 어려운 이유: 조작의 핵심은 '접촉 순간과 물체의 반응'에 있습니다. 옷을 접는 과정은 마찰 및 변형이 관련되므로 시뮬레이션에서 왜곡되기 쉽습니다. 유연하고 쉽게 변형되는 물체가 강체보다 어렵습니다. 반면, 나무 블록이나 많은 pick-and-place 임무는 접촉 동역학(contact dynamics)을 예측할 수 있어 시뮬레이션이 비교적 성숙합니다.
4 강체—유연체 스펙트럼: '물체/환경이 더 강하고 변형이 적을수록 시뮬레이션이 정확하며, 더 부드럽고 마찰/접촉 세부 사항에 의존할수록 실제 데이터가 필요하다'는 결론입니다. 이는 이후 조작 일반화가 여전히 약하여 실제 시연과 기초 모델링이 필요한 이유를 위한 배경 지식입니다.
제(4)부 실제로 위임 가능한 임무, 연구 최전선 전이, 전신 조작 및 성공률 곡선 (30% - 42%)
1 연구원 관점의 '위임' 역설: 진행자가 생활 속에서 로봇을 사용하기에 충분히 좋아진 사례가 있는지 질문했습니다. Keerthana는 연구자들이 계속해서 '이미 해결된 영역'으로 밀려나고 있다고 말합니다. 초기 pick-and-place도 어려웠지만, 지금은 기초 모델(foundation model)이 쉽게 처리하며, 최전선은 인간형 전신 조작으로 이동하고 있습니다.
2 그리퍼에서 인간형 손으로의 도약: 초창기 시연에서는 주로 그리퍼(gripper)를 사용했지만, 최근 1~2년 동안은 인간형 손을 사용하게 되었습니다. Gemini Robotics는 '일반화가 가능한 전신 조작 (whole-body manipulation with generalization)'을 구현했습니다. 즉, 걸어 다니거나 스쿼트하는 동시에 물건을 잡고 놓으며 폐쇄 루프(closed loop)로 작동하고 다양한 물체에 대해 추론합니다. 1년 전만 해도 지금 할 수 있다는 것에 놀랄 만한 수준입니다. 트위터에서 물뿌리개를 가지고 스쿼트하며 잡는 영상을 예로 들 수 있습니다.
3 METR식 임무 길이 및 성공률 프레임워크: '임무 지속 시간/사람이 얼마나 오래 하는가'의 난이도 축을 도입하고, 여기에 50%/80%/99%의 성공률을 중첩시킵니다. 현실의 로봇은 컴퓨터 LLM처럼 오류를 허용하지 못합니다. 물건을 떨어뜨리거나 고장 나면 문제가 됩니다. pick-and-place는 높은 성공률로 배포가 임박했지만, 긴 시퀀스, 부드러운 물체, 정교한 의사 결정에서는 여전히 낮은 수준입니다.
4 일반화와 숙련도의 직교 관계: 매우 좁은 전문 AI를 구축하여 단일 임무의 성공률을 극도로 높이는 것은 가능하지만, 그 비용이 임무 수에 따라 희석되지 않습니다. 범용적인 기반 모델(general baseline)은 '모든 배를 들어 올리는 조수'와 같아서, 먼저 체화된 상식/범용 이해 능력을 갖춘 후 숙련도 높은 수준으로 빠르게 미세 조정하는 방식입니다. 로봇 역시 LLM이 전문 영역에서 범용 기반 모델로 이동했던 경로를 재현할 것이라고 생각합니다.
제(5)부 소수 샘플/단일 샘플 일반화, 컨텍스트 학습 및 '로봇은 몇 개의 GPT에 해당'하는 포지셔닝 (42% - 50%)
1 비디오/이미지/언어 프롬프트 기반 조작: 로봇에게 '한 번 시연해 주는 것'을 video prompting으로 간주합니다. 텍스트 프롬프트를 통해 본 적 없는 물체를 잡는 것은 언어 일반화이며, 영역 지정(bounding box) 이미지는 image prompting이고, 전체 시연은 video prompting입니다. in-context로 학습할 수 있다는 것은 배포 및 시범 교육 비용을 크게 낮출 수 있습니다.
2 기억 복사 vs 진정한 일반화: ICL (In-Context Learning) 역시 단순히 시연을 '따라 하는' 경향이 있음을 지적합니다. 만약 환경, 물체, 요구사항이 바뀌었을 때 적응하는지가 핵심입니다. '쓰레기 봉지 묶기'와 같은 다단계의 부드러운 조작은 현재도 어렵습니다. pick-place는 데이터가 많고 의미론적으로 단순하여 소수 샘플 학습이 더 성숙합니다.
3 점수가 여전히 GPT-2에 머무르는 두 가지 이유: 첫째, 소수 샘플 학습만으로는 방대한 다양한 임무에서 아직 충분히 안정적이지 않습니다. 둘째, cross-embodiment 문제입니다. 동일한 '뇌'를 다른 로봇/새로운 기체에 적용했을 때 작동하지 않는다면 범용적인 뇌라고 할 수 없습니다. LLM은 휴대폰, Mac, Linux 등 플랫폼을 가리지 않고 행동이 일관되지만, 로봇의 지능(brain)은 아직 이러한 신체 독립성(body independence)에는 훨씬 못 미칩니다.
제(6) 부분 Gemini Robotics 2의 세 가지 모델 구조, 지연 시간 트레이드오프 및 가정용/상업적 경로 (50% - 62%)
1. 세 모델 분담: ER2는 Gemini Flash 기반으로, 로봇에 최적화된 시스템 2식 체현 추론(embodied reasoning) 두뇌입니다. 이는 이미지/비디오/의미 이해를 수행하며 API를 통해 이미 공개되었습니다. Gemini Robotics (VLA)는 의도를 로봇 동작으로 변환하는 전략 모델이며, OnDevice 2는 축소판 버전으로 로봇 자체에서 구동되어 클라우드에 의존하지 않습니다. 기능은 유사하지만 온디바이스 컴퓨팅 능력의 한계가 있습니다.
2. Gemini 3.5 Flash 기반 능력 및 추론 오버헤드: 멀티모달(multimodal) 및 사고 사슬(Chain-of-Thought, CoT) 기능을 갖추고 있지만, CoT와 대규모 멀티모달 추론은 응답 지연 시간(latency)을 유발합니다. 진행자가 자가 테스트한 결과,
제(9)부 전신 제어 빈도, 크로스-바디 영지식 학습, 오케스트레이션 오류 복합 및 '계란 프라이' 신뢰성 (78% - 85%)
1. 전신 제어가 통제하는 것: VLA는 손가락 끝부터 발까지의 전체 인체 결합 제어를 필요로 하며, 이는 의미론적 목표 + 전신 감각 + 환경 인지를 요구합니다. 하위 레벨 안정화 컨트롤러가 의미론적 두뇌(semantic brain)가 없다면 균형 유지만으로는 복잡한 작업을 수행할 수 없습니다. '안정성'과 '작업 수행'을 완전히 분리된 두 시스템으로 보는 것은 아닙니다.
2. 신뢰성 테스트 및 크로스-바디 현황: Apptronik, Agility, Boston Dynamics 등과 함께 VLA를 구축하고 있습니다. 새로운 바디에 대한 완전한 영지식(zero-shot) 고신뢰성은 아직 선례가 없습니다. OnDevice 모델은 이미 일반적인 물리 및 다중 바디 제어 기반을 가지고 있기 때문에 약 200개의 예시만으로도 다양한 기체에서 많은 작업을 학습할 수 있습니다.
3. ER+VLA 오케스트레이션 및 오류 복합: 다단계 작업에서 ER은 추진/전환을 담당하고 VLA가 실행합니다. 두 시스템 모두 개별적인 성공률을 가지며, 이를 연결하면 전체 성공률이 곱셈식으로 하락합니다. 지연 시간(latency), 작업 전환, 완료 판정 등이 실패 요인이 될 수 있으며, 단순히 '손이 제대로 잡지 못한' 문제에 국한되지 않습니다.
4. 계란 프라이와 같은 비가역적 작업 비교: 전용 데이터와 튜닝을 통해 계란 프라이는 고신뢰성으로 수행할 수 있습니다. 하지만 범용 모델은 사용자의 가스레인지를 본 적이 없다면 실패할 수 있습니다. 너무 익거나, 뒤집히거나, 바닥에 흘린 달걀 액체는 청소 위험을 초래합니다. 레고 조립처럼 잘못된 부분을 다시 할 수 있는 작업을 허용하는 것이 배치하기 더 쉽지만, 한 번의 실수로 모든 것을 망치는 작업은 진입 장벽이 훨씬 높습니다.
제(10)부 로봇 팔 하드웨어 발전, 이형 바디, 장난감 로봇, 소프트 로봇 및 전시회 경험 (85% - 91%)
1. 단일 그리퍼에서 다지(多指)의 민첩성으로: Gemini Robotics 1(약 작년 3월)은 그리퍼의 민첩성을 선보였습니다. 1년 이상 지난 후 2세대는 다지 구조, 비닐봉투 걸기, 미세 힘 제어 기능을 구현했습니다. 손이 새로운 민첩성의 최전선이 되었으며, 그리퍼가 더 이상 가장 어려운 부분이 아닙니다. 시중에 여러 모델의 손을 연구할 수 있지만, 여전히 더 신뢰성 있고, 반복 가능하며, 가격이 저렴해야 합니다.
2. 힘과 캔 따기 시나리오: 다양한 손 모델 간에 차이가 큽니다. Wuji 손은 약 10세 아동의 힘/사람 크기에 가깝고, Shadow 손은 약 20kg을 들 수 있으며 캔을 딸 수는 있지만 매우 단단한 병뚜껑까지는 어려울 수 있습니다. 이는 '병 따기(opening a jar)'가 여전히 인간과 로봇 간의 분업 코미디가 될 수 있음을 시사합니다.
3. 이형 및 장미지(Long-tail) 바디: 신뢰성 계획에서는 드론에 로봇 팔을 장착하는 등 기이한 형태도 등장했습니다. 전반적인 바디 분포는 양팔, 손, 휴머노이드가 주를 이루며 나머지는 꼬리 부분입니다. 데이터만 있다면 이상한 바디도 학습할 수 있습니다. 장난감 분야에서는 초기 테이블 대전/게임 로봇들이 신기함 때문에 구매된 후 방치되는 경우가 많았습니다. 이제는 거대 언어 모델(LLM)과 연결되면서 상황이 변할 수 있지만, 소비용 장난감 시장은 아직 폭발하지 않았습니다.
4. 소프트 및 촉각, 전시회 관찰: 소프트 로봇은 연체/소프트 핸드로 나뉘며, AI 제어의 핵심은 반복 가능성, 내구성, 그리고 촉각 글러브(UMI 계열)입니다. 순수 기계식 소프트 로봇은 여전히 연구 단계에 있습니다. Keerthana는 상하이 WIC에 참가하여 많은 시연이 연출된 것처럼 보이고 일반화가 부족하다고 느꼈습니다. 텐센트의 반인형 마사지 의자는 짧게 누르는 것은 아프지 않지만, 인간의 마사지가 여전히 더 좋았습니다.
제(11)부 안전 정렬, 의인화 상호작용 자세, 세계 모델/데이터 경로 및 원거리 뇌-기계 인터페이스/바디 (91% - 100%)
1. 안전이 곧 능력: 안전하지 않은 로봇은 채택되지 않습니다. 작동 안전(사람의 실수나 고장으로 사람을 부딪히거나, 넘어지거나, 누르는 것 방지)과 상위 레벨 정렬 안전(가드레일을 넘지 않기, 감지된 이상 상황에서 무작정 행동하지 않기)이 있습니다. 예를 들어, 인형 머리에 바구니를 씌워 시야를 가리는 경우, 올바른 반응은 요청하는 것이지 맹목적으로 행동하는 것이 아닙니다.
2. 휴머노이드가 가져오는 인지 혼란 및 HRI: 사람들은 의인화된 외모 때문에 로봇을 사람으로 착각하면서도 그것이 기계라는 것을 알고 있어 경계가 모호합니다. 휴머노이드가 실수하면 더 엄격하게 비판받습니다. GR2의 HRI 자세는 하드코딩된 고개가 아니라, 모델이 대화에 따라 자연스럽게 생성하는 제스처입니다. 촬영 인터뷰에서 로봇은
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기