MemPilot: LLM 에이전트를 위한 온디맨드 멀티모달 메모리 큐레이션 오케스트레이션
요약
MemPilot은 LLM 에이전트가 상호작용 전반에 걸쳐 정보를 효율적으로 보존하고 재사용하기 위한 온디맨드 멀티모달 메모리 큐레이션 오케스트레이션 프레임워크입니다. 이 시스템은 강화학습(RL)을 활용하여, 성능-비용-지연 시간 등 다양한 목표 선호도에 따라 최적의 메모리 검색 및 큐레이션 방식을 동적으로 선택합니다. 이를 통해 에이전트 컴퓨팅 자원의 세밀한 할당과 효율적인 트레이드오프 관리가 가능해집니다.
핵심 포인트
- MemPilot은 온디맨드 멀티모달 메모리 큐레이션을 오케스트레이션하는 프레임워크입니다.
- 강화학습(RL)을 통해 성능, 비용, 지연 시간 등 다양한 목표를 최적화합니다.
- 객체별 장점 분리 및 접두사 기반 한계 효용 추정 기법이 적용되었습니다.
- 다양한 벤치마크에서 우수한 트레이드오프와 넓은 경계를 입증했습니다.
메모리는 상호작용 전반에 걸쳐 정보 보존 및 재사용을 지원하며, LLM 에이전트 생태계의 필수 요소가 되었습니다. 하지만 기존의 대부분의 에이전트 메모리 시스템은 쿼리-불가지론적(query-agnostic) 방식으로 메모리를 구성하여 불필요한 전처리 비용을 발생시키고 나중에 필수적인 세부 정보를 폐기할 수 있습니다. 최근 연구들은 메모리 처리를 런타임 적응 방향으로 전환하기 시작했지만, 일반적으로 특정 연산이나 고정된 처리 방식에 특화되어 있어 성능(performance), 비용(cost), 지연 시간(latency)에 대한 유연한 제어가 크게 탐구되지 않은 상태입니다. 이러한 문제를 해결하기 위해, 우리는 다양한 성능-비용-지연 시간 선호도 하에서 온디맨드 메모리 큐레이션을 오케스트레이션하는 유연한 프레임워크인 MemPilot을 제시합니다. 구체적으로, 우리는 강화학습(RL)을 통해 다단계 LLM 정책을 최적화하여, 쿼리-불가지론적 메모리에서 검색할지 아니면 원시 멀티모달 히스토리의 쿼리별 큐레이션을 이기종 LLM 및 VLM에 위임할지 반복적으로 선택합니다. 이 정책은 증거량(evidence amount), 큐레이션 지침, 모델 선택, 시각적 접근을 공동으로 제어하여 런타임 컴퓨팅의 세밀한 할당이 가능하게 합니다. 상충하는 목표들 하에서 이 정책을 최적화하기 위해, 우리는 각 목표의 장점(advantage)을 별도로 추정하여 집계하기 전에 객체별 장점 분리(objective-wise advantage decoupling)를 적용합니다. 또한, 다단계 롤아웃 전반에 걸쳐 세밀한 크레딧 할당을 위한 접두사 기반 한계 효용 추정(prefix-based marginal utility estimation)을 도입했습니다. 다섯 가지 멀티모달 에이전트-메모리 벤치마크에서 수행된 실험은 최적화 선호도 전반에 걸쳐 우수한 성능-비용-지연 시간 트레이드오프를 입증했으며, 선호도 스윕(preference sweeps)을 통해 기존의 트레이드오프 인식 기반 베이스라인보다 더 넓은 경계를 제공했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기