필요할 때만 질문하기: 경험 기반의 기억 및 기술을 활용한 능동적 검색 (Proactive Retrieval from Memory and Skills for Experience-Driven Lifelong Agents)
요약
기존의 온라인 평생 학습(Online lifelong learning) 에이전트들은 과거 경험을 수동적으로 활용하여, 특정 시점(예: 태스크 초기화 또는 스텝 완료 후)에만 지식을 검색하는 한계가 있었습니다. 본 논문은 이러한 문제를 해결하기 위해 'ProactAgent'라는 새로운 프레임워크를 제안합니다. ProactAgent는 구조화된 경험 기반에서 능동적으로 정보를 검색하며, 특히 'Proactive Reinforcement Learning-based Retrieval (ProactRL)'을 도입하여 검색 자체를 명시적인 정책
핵심 포인트
- ProactAgent는 경험 기반의 온라인 평생 학습 프레임워크로, 과거 지식 활용의 수동적 한계를 극복합니다.
- Experience-Enhanced Online Evolution (ExpOnEvo)를 통해 정책 업데이트와 메모리 정제(memory refinement)를 동시에 수행하며 지속적인 개선을 가능하게 합니다.
- ProactRL은 검색 과정을 명시적인 정책 액션으로 모델링하고, 쌍방향 보상(paired-branch process rewards)을 사용하여 필요한 순간에만 검색하도록 학습합니다.
- SciWorld와 AlfWorld 실험에서 ProactAgent는 각각 73.50% 및 71.28%의 성공률을 달성하며, 기존 방식 대비 높은 성능과 효율성을 입증했습니다.
온라인 평생 학습(Online lifelong learning)은 에이전트가 상호작용 전반에 걸쳐 경험을 축적하고 장기적인 작업(long-horizon tasks)에서 지속적으로 개선할 수 있게 합니다. 그러나 기존 방법들은 과거 경험으로부터의 검색(retrieval from past experience)을 일반적으로 수동적인 작업으로 취급하여, 오직 작업 초기화 시나 단계를 완료한 후에만 트리거합니다. 결과적으로 에이전트는 상호작용 중에 지식 격차(knowledge gaps)를 식별하거나 현재 결정에 가장 유용한 경험을 능동적으로 검색하는 데 실패하는 경우가 많습니다. 이러한 한계점을 해결하기 위해, 우리는 구조화된 경험 기반(structured experience base) 위에서 능동적 검색을 위한 경험 기반 평생 학습 프레임워크인 ProactAgent를 제시합니다. 먼저, 우리는 정책 업데이트와 메모리 정제(memory refinement) 모두를 통해 지속적인 개선을 가능하게 하는 Experience-Enhanced Online Evolution (ExpOnEvo)을 소개합니다. 이 경험 기반은 역사적 상호작용을 사실적 기억(factual memory), 에피소드 기억(episodic memory), 행동 기술(behavioral skills)을 포함하는 유형별 저장소로 구성하여, 검색이 관련 증거와 실행 가능한 지침을 모두 제공할 수 있도록 합니다. 그 위에, 우리는 검색을 명시적인 정책 행동으로 모델링하고 쌍방 분기 과정 보상(paired-branch process rewards)을 통해 언제 무엇을 검색해야 하는지를 학습하는 Proactive Reinforcement Learning-based Retrieval (ProactRL)을 제안합니다. ProactRL은 동일한 상호작용 접두사(interaction prefixes)로부터의 연속성(continuations)을 검색 유무에 따라 비교함으로써, 검색 결정에 대한 단계별 감독(step-level supervision)을 제공하며, 검색이 더 나은 작업 결과나 높은 효율성을 가져올 때만 이를 장려합니다. SciWorld, AlfWorld, 그리고 StuLife에서의 실험 결과는 ProactAgent가 평생 에이전트 성능을 일관되게 향상시키며, SciWorld에서 73.50%, AlfWorld에서 71.28%의 성공률을 달성하는 동시에 검색 오버헤드를 실질적으로 줄이고, StuLife에서는 독점 모델(proprietary models)과 경쟁할 수 있는 성능을 달성함을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기