LLM 에이전트는 선언한 계획을 실행하는가? 계획 모드 선언에서 패턴별 실행까지
요약
본 연구는 LLM 에이전트가 계획을 수립하고 실행하는 과정에서 발생하는 '계획 선언-실행 격차'를 다룹니다. 이를 해결하기 위해 '플래닝-어즈-라우팅(Planning-as-Routing)' 방식을 제안합니다. 이 방식은 LLM이 네 가지 계획 모드 중 하나를 선언하면, 결정론적 라우터가 해당 패턴별 실행기로 작업을 전송하여 구조 유지 및 성공률을 크게 향상시킵니다.
핵심 포인트
- Plan+ReAct는 긴 계획에서 구조 유지에 취약합니다. 패턴별 실행기는 의도된 계획 구조를 강제합니다.
- 최적의 계획 모드는 환경(ALFWorld, SWE-bench)과 모델에 따라 다릅니다.
- 패턴별 실행기를 사용하면 작업 성공률이 기존 Plan+ReAct 대비 크게 향상됩니다.
- 신뢰할 수 있는 에이전트 계획은 효과적인 모드 선택과 충실한 실행 모두를 필요로 합니다.
대규모 언어 모델(LLMs)은 에이전트가 계획을 생성하고 환경에서 이를 실행함으로써 장기 지평(long-horizon) 과제를 해결할 수 있도록 합니다. 그러나 성공적인 계획 수립에는 두 가지 별개의 능력이 필요합니다: 작업에 적합한 계획을 선택하는 것과 그것을 충실하게 실행하는 것입니다. 기존의 플래너-실행기 시스템은 어느 단계에서든 실패할 수 있으며, 최종적인 작업 성공만으로는 선택 실패와 실행 실패를 구별할 수 없습니다. 따라서 우리는 '계획 선언-실행 격차(Plan Declaration--Execution Gap)'를 연구하고, '플래닝-어즈-라우팅(Planning-as-Routing)'을 도입합니다. 이 방식에서는 LLM이 네 가지 계획 모드 중 하나를 선언하면 (사전 정의형(Predefined), 순차형(Sequential), 계층적(Hierarchical), 또는 검색(Search)), 결정론적 라우터가 해당 패턴별 실행기로 작업을 전송합니다. 네 개의 벤치마크와 세 개의 LLM에 걸쳐, 우리는 세 가지 일관된 패턴을 발견했습니다. 첫째, 일반적인 Plan+ReAct는 특히 더 긴 계획의 경우 선언된 계획 구조를 유지하는 데 실패하는 경우가 많습니다: 세 개의 벤치마크 중 오직 (22)--(45%)의 궤적만이 이를 유지했지만, 패턴별 실행기들은 의도된 구조를 강제합니다. 둘째, 계획 모드의 효과는 환경과 모델에 따라 다릅니다: ALFWorld에서는 검색(Search)이 가장 성능이 좋고, SWE-bench에서는 계층적(Hierarchical)이 가장 좋은 반면, 동일한 벤치마크 내에서도 가장 강력한 패턴은 모델마다 달라질 수 있습니다. 셋째, 가장 큰 개선점은 실행 단계에서 나옵니다: 패턴별 실행기는 ALFWorld에서 작업 성공률을 (0.48)에서 (0.92)로, SWE-bench에서는 (0.36)에서 (0.44)로 Plan+ReAct보다 향상시킵니다. 하지만 현재의 LLM들은 각 작업에 가장 강력한 모드를 신뢰성 있게 선택하지 못하며, 몇 가지 예시(few-shot examples)가 일부 벤치마크-모델 조합에서는 선택을 개선시키기는 합니다. 전반적으로, 신뢰할 수 있는 에이전트 계획은 효과적인 모드 선택과 충실한 실행 둘 다를 필요로 합니다: 라우팅은 실행 격차를 상당히 줄여주지만, 작업별 모드 선택은 여전히 미개척 영역으로 남아 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기