LiveMACE: 진화하는 시장에서 LLM 에이전트 역량의 프로세스 기반 평가
요약
본 글은 LLM 에이전트를 단순히 최종 결과로만 평가하는 한계를 지적하며, 실시간 금융 시장을 활용한 프로세스 기반 벤치마크 'LiveMACEBench'를 제안합니다. 이 벤치마크는 도구 사용, 메모리, 규칙 준수 등 여러 메커니즘별 진단을 통해 에이전트의 실제 역량을 측정할 수 있게 합니다.
핵심 포인트
- 결과만으로는 에이전트의 근본적인 역량 파악 불가
- LiveMACEBench는 실시간 금융 시장을 테스트베드로 활용
- 메커니즘별 진단으로 '결과-역량 격차' 분석 가능
- 에이전트 역량은 여러 메커니즘 지표로 측정됨
단순히 결과(outcomes)만으로 에이전트를 평가하는 것은 그 결과를 만들어낸 역량을 가릴 수 있습니다. 이 문제는 특히 환경이 변화하는 경우에 두드러지게 나타나는데, 이때 결과는 에이전트 행동과 변화하는 외부 조건 사이의 폐쇄 루프 상호작용을 반영하기 때문입니다. 우리는 LiveMACEBench를 소개합니다. 이는 실시간 금융 시장을 지속적으로 진화하는 테스트베드로 활용하여 프로세스 기반(process-aware) 벤치마크입니다. 다섯 가지 최첨단 LLM이 매칭된 도구 사용(Tool Use), 영속적 메모리(Persistent Memory), 규칙 준수(Rule Following), 그리고 다중 에이전트 협업(Multi-Agent Collaboration) 구성을 따라 연속적인 궤적을 그리며 작동합니다. 우리는 이들을 실현된 결과와 완전한 의사 결정 추적(decision traces)에서 파생된 메커니즘별 진단(mechanism-specific diagnostics) 모두를 통해 평가합니다. 30일간의 라이브 평가를 거치면서, 우리는 두드러진 '결과-역량 격차(outcome-capability gap)'를 발견했습니다. 즉, 실현된 수익률이 역량별 측정값과 종종 다르게 나타나며, 유사한 결과가 현저히 다른 메커니즘 사용 패턴에서 발생할 수 있습니다. 추적 수준의 진단은 또한 역량 전반에 걸쳐 뚜렷한 병목 지점들을 노출시키며, 메커니즘 접근성(mechanism access), 효과적인 메커니즘 사용(effective mechanism use), 그리고 다운스트림 성능이 에이전트 역량을 측정하는 상호 교환 가능한 지표가 아님을 입증합니다. LiveMACEBench는 이러한 구분을 측정 가능하게 만들어, 실시간 시장을 단순한 성능 리더보드에서 에이전트 역량 진단 환경으로 전환시킵니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기