State2State: LLM 에이전트를 위한 환경 유도형 중간 학습 (Environment-Derived Mid-Training)
요약
State2State는 외부의 감독 없이 환경과의 상호작용만으로 LLM 에이전트의 능력을 학습시키는 새로운 중간 학습 방법론을 제안합니다. 환경 상태를 목표 상태로 변환하여 스스로 도전 과제를 생성함으로써 학습의 확장성과 일반화 성능을 높입니다.
핵심 포인트
- 전문가 궤적이나 수동 작업 설계 없이 환경 상호작용만으로 학습 가능
- 환경 탐색을 통해 스스로 학습 목표를 도출하는 State2State 방법론 제안
- ALFWorld 및 ScienceWorld 실험을 통해 에이전트 성능 향상 입증
- 다운스트림 강화 학습의 초기화 단계로 활용 시 학습 효율 극대화
LLM 에이전트를 학습시키는 것은 일반적으로 전문가의 궤적 (expert trajectories)으로부터의 지도 미세 조정 (supervised fine-tuning) 또는 수작업으로 제작된 검증기 (handcrafted verifiers)를 포함한 인간이 지정한 작업에 대한 온라인 강화 학습 (online reinforcement learning)에 의존합니다. 효과적이기는 하지만, 두 방식 모두 외부에서 지정된 작업과 감독 신호 (supervision signals)에 의해 병목 현상이 발생하며, 이는 에이전트 학습의 확장성 (scalability)과 다양성을 제한합니다. 우리는 외부에서 지정된 작업 없이, 오직 환경과의 상호작용만을 통해 에이전트가 상호작용 및 조작 능력을 습득하는 환경 학습 패러다임을 연구합니다. 우리는 탐색된 환경 상태 (environment states)를 특정 목표 상태 (target state)에 도달하도록 에이전트에게 도전 과제를 부여하는 방식으로 변환하는, 환경 유도형 중간 학습 (environment-derived mid-training) 방법론인 State2State를 제안합니다. 환경 탐색으로부터 작업을 도출하고 규칙 기반의 상태 매칭 (rule-based state matching)을 통해 성공 여부를 검증함으로써, State2State는 전문가의 감독이나 수동적인 작업 설계 없이도 확장 가능하고 검증 가능한 학습 목표를 제공합니다. ALFWorld 및 ScienceWorld에서의 실험 결과, State2State는 대부분의 설정에서 독립적인 환경 학습 단계로서 에이전트의 성능을 향상시킴을 보여줍니다. 다운스트림 강화 학습 (downstream RL)을 위한 초기화 단계로 사용할 경우, 최종 성능과 학습 효율을 더욱 향상시키며, 환경 간 일반화 (cross-environment generalization)에 대한 유망한 증거를 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기