에이전트 로봇을 위한 재귀적 비디오 인컨텍스트 학습 (RV-ICL)
요약
본 논문은 에이전트 로봇의 성능을 높이기 위해 '재귀적 비디오 인컨텍스트 학습(RV-ICL)'이라는 새로운 방법을 제안합니다. RV-ICL은 데모 영상을 단순한 프롬프트가 아닌, 계층적인 구조로 변환하여 에이전트에게 제공합니다. 이 구조는 전체 과제부터 세부 접촉 디테일까지 점진적으로 정보를 깊게 탐색할 수 있게 합니다.
핵심 포인트
- RV-ICL은 데모 영상을 계층적 구조로 변환하는 비지도 학습 방법입니다.
- 에이전트는 계획 단계에서 거친 수준을 먼저 읽고, 필요할 때만 세부 클립으로 재진입합니다.
- LIBERO-PRO 및 LIBERO-Plus 벤치마크에서 성공률을 크게 향상시켰습니다.
텍스트 메모리를 통해 에피소드 전반에 걸쳐 성능이 향상되는 LLM 에이전트는 고정된 시각-언어-행동(VLA) 정책을 오케스트레이션합니다. 이 텍스트 메모리는 에이전트가 무엇을 했는지는 기록하지만, 과제가 어떻게 수행되어야 하는지에 대한 정보는 담지 못합니다. 데모 영상은 이를 보여주지만, 에이전트의 컨텍스트에 잘 통합되지 않습니다. 전체 비디오는 매 턴마다 속도가 느려지고, 고정된 키프레임들은 그리핑이 성공할지 여부를 결정하는 접촉 디테일을 놓치며, 에이전트가 필요로 하는 정보는 계획 단계에서 과제의 구조에서 각 접촉 주변의 프레임으로 이동합니다. 우리는 데모를 에이전트가 받는 프롬프트가 아닌, 에이전트가 탐색하는 계층 구조로 변환하는 훈련 없는 방법인 재귀적 비디오 인컨텍스트 학습(Recursive Video In-Context Learning, RV-ICL)을 소개합니다. 이 계층 구조는 그리핑 및 해제와 같은 데모의 하위 이벤트들로부터 구축됩니다. 그 레벨은 전체 과제의 키프레임에서 단계(phases), 순간(moments), 그리고 짧은 클립까지 점점 더 세밀해지며, 읽기 전용 도구(read-only tools)를 통해 노출됩니다. 에이전트는 계획하기 전에 거친 수준(coarse levels)을 먼저 읽습니다. 실행 중에는 한 단계에 더 많은 디테일이 필요할 때마다 계층 구조로 재진입하여 현재 하위 목표의 클립만 로드합니다. 과제당 하나의 데모만으로 충분합니다. RPent를 기반으로 하는 RV-ICL은 LIBERO-PRO에서 성공률을 92.6%에서 96.5%로, 그리고 LIBERO-Plus에서 86.7%에서 95.8%로 향상시킵니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기