적대적 POMDP 환경 내 복합 LLM 에이전트 설계의 비용 대비 성능 연구
요약
본 연구는 적대적 POMDP 환경인 CybORG CAGE-2를 대상으로 복합 LLM 에이전트의 설계 요소가 성능과 비용에 미치는 영향을 분석했습니다. 실험 결과, 복잡한 숙고(Deliberation) 도구를 남용하기보다 프로그래밍 방식의 상태 추상화와 효율적인 작업 분해에 집중하는 것이 비용 대비 성능(RPTS) 측면에서 훨씬 유리함을 입증했습니다.
핵심 포인트
- 프로그래밍 방식의 상태 추상화는 원시 관측값 대비 평균 보상을 최대 76% 향상시키며 가장 높은 토큰당 수익(RPTS)을 제공합니다.
- 계층 구조 전체에 숙고 도구를 분산 배치할 경우, 토큰 사용량은 늘어나고 보상은 급격히 떨어지는 '숙고 폭포(Deliberation cascade)' 현상이 발생합니다.
- 숙고 과정이 없는 계층적 분해가 대부분의 모델에서 최고의 절대 성능을 달성하며, 문맥 엔지니어링이 숙고보다 비용 효율적입니다.
- 에이전트의 깊은 추론 능력에 투자하기보다 구조화된 인프라와 명확한 작업 분해에 집중하는 것이 설계 원칙으로 권장됩니다.
적대적이고 부분적으로 관찰 가능한(Partially Observable) 순차적 환경에 복합 LLM 에이전트를 배치하려면 여러 설계 차원을 고려해야 합니다: (1) 에이전트가 무엇을 보는가, (2) 어떻게 추론하는가, (3) 구성 요소 간에 작업이 어떻게 분해되는가. 그러나 실무자들은 어떤 설계 선택이 성능을 향상시키는지, 아니면 단순히 추론 비용(Inference cost)만 증가시키는지에 대한 지침이 부족한 상황입니다. 본 연구에서는 부분 관측 마르코프 결정 과정(Partially Observable Markov Decision Process, POMDP)으로 모델링된 사이버 방어 환경인 CybORG CAGE-2에서 복합 LLM 에이전트 설계에 대한 통제된 연구를 제시합니다. 보상(Reward)이 비양수(non-positive)이므로, 모든 구성은 실패 완화 모드에서 작동합니다. 우리의 평가는 5개의 모델 제품군, 6개의 모델, 그리고 12개의 구성(3,475 에피소드)을 대상으로 토큰 수준의 비용 계산을 포함하여 수행되었습니다. 우리는 문맥 표현(원시 관측값 vs 압축된 이력을 가진 결정론적 상태 추적 레이어), 숙고(Self-questioning, self-critique, self-improvement 도구 및 선택적 사고 사슬(Chain-of-thought) 프롬프팅), 그리고 계층적 분해(단일형 ReAct vs 전문화된 하위 에이전트로의 위임)를 변화시키며 실험했습니다. 연구 결과는 다음과 같습니다: (1) 프로그래밍 방식의 상태 추상화(Programmatic state abstraction)는 사용된 토큰당 가장 큰 수익(Returns Per Token Spent, RPTS)을 제공하며, 원시 관측값 대비 평균 보상을 최대 76%까지 향상시킵니다. (2) 숙고 도구를 계층 구조 전체에 분산시키는 것은 5개 모델 제품군 모두에서 계층 구조만 사용할 때보다 성능을 저하시키며, 1.8~2.7배 더 많은 토큰을 사용하면서 평균 보상은 최대 3.4배까지 나빠집니다. 우리는 이러한 파괴적인 패턴을 숙고 폭포(Deliberation cascade)라고 부릅니다. (3) 숙고 없는 계층적 분해는 대부분의 모델에서 최고의 절대적 성능을 달성하며, 문맥 엔지니어링(Context engineering)은 일반적으로 숙고보다 비용 효율적입니다. 이러한 발견은 구조화된 적대적 POMDP를 위한 설계 원칙을 제시합니다: 에이전트당 더 깊은 추론에 투자하기보다는 프로그래밍 방식의 인프라와 깔끔한 작업 분해에 투자하십시오. 이러한 전략들은 결합될 때 서로 간섭할 수 있기 때문입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기