로봇이 잘못 작동하는 것이 아니다. 다른 답을 찾은 것이다.
요약
본 글은 로봇이 '잘못' 작동하는 것이 아니라, 주어진 환경과 제약 조건 하에서 인간보다 효율적인 새로운 움직임 패턴을 스스로 발견했음을 설명합니다. 특히 강화학습(Reinforcement learning) 과정에서 로봇은 에너지 효율성을 극대화하기 위해 기존의 휴머노이드 형태와는 다른 독특한 자세를 채택했습니다.
핵심 포인트
- 로봇의 움직임은 오류가 아닌, 최적화된 새로운 해답이다.
- 강화학습은 에너지 효율성을 극대화하는 정책을 스스로 찾아낸다.
- 로봇은 인간적인 형태를 가졌으나, 걸음걸이는 비인간적으로 진화했다.
로봇이 잘못 작동하는 것이 아니다. 그것은 다른 답을 찾았다.
강화학습(Reinforcement learning)은 뻣뻣한 팔과 앞으로 기울어진 자세를 인간처럼 보이는 어떤 것보다 유지했다.
우리는 걸을 때마다 몸통에 가해지는 비틀림을 상쇄하기 위해 팔을 흔든다. 힘줄이 그 대부분의 일을 공짜로 해낸다.
로봇 팔은 모터, 기어, 와이어일 뿐이다. 그 비틀림을 상쇄할 만큼 충분히 빠르게 휘두르면, 한 바퀴를 도는 동안 매 걸음마다 토크(torque)를 지불해야 한다.
기울임이 나머지를 담당한다. 발 앞에 질량을 두어 각 스텝에서 똑바로 서 있는 데 쓰는 에너지를 줄이고, 그 에너지를 앞으로 나아가는 데 더 많이 사용하게 만든다.
아무도 그런 자세를 설계하지 않았다. 정책(policy)이 그것을 찾아냈다. 왜냐하면 여기서의 제약 조건은 칼로리가 아니기 때문이다. 시간당 열과 토크가 제약 조건이다.
우리는 로봇들이 우리 세상 속을 움직일 수 있도록 휴머노이드 형태를 선택했다. 하지만 훈련 과정은 그들이 우리처럼 움직이지 않도록 결정하는 것이었다.
앉는 부분에 주목할 점:
형태는 인간적이었다. 걸음걸이는 아니었다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @nainsidwiv50980 (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기