DAEDALUS: 자체 생성된 태스크로부터 에이전트 메모리 부트스트래핑
요약
본 논문은 기존 지식이나 가이드라인 없이 자체 생성된 연습을 통해 에이전트 메모리를 구축하는 DAEDALUS를 제안합니다. DAEDALUS는 환경과 상호작용하여 도전적인 태스크를 만드는 탐색자와, 이를 시도하고 실패로부터 휴리스틱을 도출하는 해결자로 구성됩니다. 이 방법은 다양한 벤치마크에서 높은 성공률 향상과 낮은 추론 비용을 입증했습니다.
핵심 포인트
- DAEDALUS는 자체 생성된 연습으로 에이전트 메모리를 부트스트래핑합니다.
- 탐색자와 해결자 두 에이전트를 결합하여 작동하며, 실패로부터 휴리스틱을 도출합니다.
- AppWorld 등 여러 벤치마크에서 높은 성공률 향상과 효율성을 보였습니다.
- 메모리 구축 외에도 생성된 태스크가 효과적인 벤치마크 프록시 역할을 할 수 있음을 보여줍니다.
LLM 에이전트는 새로운 환경에서 안정적으로 작동하는 데 필요한 운영 지식(operational knowledge)이 부족한 경우가 많습니다. 왜냐하면 특정 도구 동작이나 환경 규칙을 스스로 발견해야 하기 때문입니다. 과거 시도에 대한 기억이 없으면, 태스크 전반에 걸쳐 같은 실수를 반복하게 되어 더 많은 태스크 실패와 긴 추적 경로(trajectories)를 초래합니다. 이를 해결하기 위해 에이전트 시스템은 일반적으로 사람이 작성한 가이드라인이나 훈련 태스크 및 오라클 검증기(oracle verifier)로부터 구축된 절차적 메모리(procedural memory)에 의존하는데, 이 둘 모두 환경에 대한 사전 지식을 요구합니다. 본 논문에서는 기존의 태스크나 오라클 검증기 없이 자체 생성된 연습으로부터 재사용 가능한 에이전트 메모리를 부트스트래핑하는 방법인 DAEDALUS를 제시합니다. DAEDALUS는 두 개의 에이전트를 결합합니다: 환경과 상호작용하여 도전적이면서도 해결 가능한 태스크를 생성하는 탐색자(explorer)와, 이를 시도하는 해결자(solver)입니다. 각 해결자의 실패로부터 휴리스틱(heuristic)을 도출하며, 이 휴리스틱은 해결자가 해당 컨텍스트에서 반복적으로 성공할 때만 채택됩니다. 이러한 결과는 또한 탐색자가 미래 태스크의 난이도를 개선하기 위한 피드백을 제공합니다. 채택된 휴리스틱들은 테스트 시간 사용을 위해 메모리 뱅크로 통합됩니다. AppWorld, $ au^2$-bench, 그리고 AutomationBench 전반에 걸쳐 DAEDALUS는 메모리가 없는 기준선(no-memory baseline) 대비 평균 성공률을 최대 15.9 포인트까지 향상시키고 pass$^5$를 최대 2.2배 향상시켰으며, 태스크를 사용한 방법들과 경쟁하면서도 대부분보다 낮은 추론 비용을 가집니다. 우리는 성능 향상이 이미 작은 탐색 예산(exploration budget)만으로 나타나며, 그 휴리스틱이 다른 모델 계열의 에이전트에게도 이점을 제공한다는 것을 보여줍니다. 추가적인 분석(ablations)을 통해 해결자 추적(solver traces)이 효과적인 휴리스틱을 도출하는 데 필요한 핵심 정보를 제공하며, 초기 발견 사항들을 분해(factorizing)하면 탐색이 더 비용 효율적이게 됨을 밝혀냈습니다. 메모리 구축을 넘어, 우리는 DAEDALUS가 생성한 태스크들이 모델 성능으로 순위를 매길 때 벤치마크 태스크의 프록시 역할을 할 수 있음을 발견했습니다. 코드 및 아티팩트: www.github.com/illuin-tech/daedalus.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기