ViSkill: 시각 기반 스킬을 활용하여 VLM 에이전트 강화하기
요약
ViSkill은 성공적인 상호작용을 VLM 에이전트가 활용할 수 있는 복합 시각 스킬 카드로 인코딩하는 시각 기반 스킬 학습 프레임워크입니다. 이 시스템은 검색된 스킬을 추론과 보상 형성 모두에 사용하며, 성공 궤적을 라이브러리로 재추출하여 스킬 축적과 정책 개선이 상호 강화되는 폐쇄 루프 피드백 시스템을 구축합니다.
핵심 포인트
- 시각 기반으로 VLM 에이전트의 스킬 학습을 강화함.
- 성공적인 궤적을 시각 스킬 카드로 인코딩하여 사용 가능하게 함.
- 스킬 축적과 정책 개선이 상호 작용하는 폐쇄 루프 시스템을 구현함.
- Sokoban 등에서 높은 성공률(0.89~0.91)을 달성하며 기존 모델을 능가함.
스킬 증강(Skill-augmented) 에이전트는 성공적인 궤적(trajectory)을 재사용 가능한 전략으로 추출함으로써 샘플 효율성을 개선합니다. 그러나 기존의 대부분 접근 방식은 여전히 텍스트 중심적이며, 공간 레이아웃과 행동-상태 대응 관계를 언어화하는 과정에서 중요한 기하학적 구조를 잃게 만듭니다. 최근 노력들은 시각적 증거(visual evidence)를 통합하기 시작했지만, 스킬을 정책 최적화와 분리하여 구성하고 업데이트함으로써 상호 개선에 대한 탐구가 부족했습니다.
저희는 ViSkill을 제안합니다. 이는 성공적인 상호작용을 VLM 에이전트가 직접 접근할 수 있는 복합 시각 스킬 카드(composite visual skill cards)로 인코딩하는 시각 기반(visual-native) 스킬 학습 프레임워크입니다. 검색된 스킬은 추론(inference)과 보상 형성(reward shaping) 모두를 안내하며, 성공적인 궤적은 라이브러리로 다시 추출되어, 스킬 축적과 정책 개선이 서로를 강화하는 폐쇄 루프 피드백 시스템을 형성합니다. 선택적인 콜드 스타트 메커니즘(cold-start mechanism)은 초기 단계 학습을 더욱 가속화합니다.
Sokoban, FrozenLake, PrimitiveSkill에서 평가된 ViSkill은 전체 성공률 0.89를 달성했으며, 콜드 스타트 초기화를 통해 0.91까지 상승하여, 평가된 모든 독점 및 오픈 소스 기반 모델을 능가하고 표준 PPO보다 빠르게 수렴했습니다. 저희 코드는 https://github.com/ZJU-REAL/ViSkill에서 이용 가능합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기