UndoBench: 도구 사용 AI 에이전트에서 작업 역량과 복구 능력을 분리하기
요약
본 논문은 기존 벤치마크가 작업 완료 능력과 오류 복구 능력을 혼동하는 문제를 지적하며, 이를 해결하기 위한 UndoBench를 제안합니다. 이 벤치마크는 실제 기업 워크플로우와 오류 시나리오를 다루며, 카운터팩추얼 실험을 통해 에이전트의 작업 역량과 조건부 복구 성공률(CRSR)을 분리하여 평가했습니다.
핵심 포인트
- UndoBench는 작업 능력과 오류 복구 능력을 분리하는 새로운 벤치마크입니다.
- 단순 재시도 방식은 중복된 외부 효과를 생성할 위험이 높습니다.
- 부분 변이 상황에서는 호출별 동일성(idempotency) 및 저널링이 중요합니다.
- 명목적 완료만 평가하는 것은 에이전트의 복구 취약점을 가릴 수 있습니다.
도구 사용(Tool-using) AI 에이전트는 기업 소프트웨어 시스템 전반에 걸쳐 점점 더 많이 배포되고 있지만, 널리 사용되는 벤치마크는 주로 명목상의 작업 완료만을 평가하여 기본적인 계획 역량과 운영상 오류 복구 능력을 혼동하고 있습니다. 우리는 UndoBench를 소개합니다. 이 벤치마크는 8개 기업 도메인에 걸쳐 36개의 기본 워크플로우와 36개의 오류 시나리오를 다루며, 동일한 시드(seed) 하에서 카운터팩추얼 쌍별 실험(counterfactual paired trials)과 와이어 레벨 효과 기록(wire-level effect-history), 환경 상태 오라클(environment-state oracles)을 통해 작업 역량과 복구 능력을 분리합니다. 두 개의 오픈 가중치 모델, 두 가지 프레임워크, 세 가지 복구 패러다임(5,760회 실행 / 2,880쌍별 실험)에 걸쳐 12개의 보류된 TEST 워크플로우에서, 동결된 손실-인식(frozen lost-acknowledgment) 연구를 수행한 결과, 명목적 역량은 83.54%에 도달했지만 조건부 복구 성공률(CRSR: conditional recovery success rate)은 46.72%로 떨어졌으며, 단순 재시도(naive retry)는 실험의 53.33%에서 중복된 외부 효과를 생성했습니다. 상용 API 모델로 확장했을 때도 이러한 역량-복구 분리가 재현되었습니다. 보완적인 실행 경계에 걸친 평가 결과는 복구가 단계 의존적임을 보여줍니다: 변이(mutation) 전에는 방법들이 중복 효과 없이 유사하게 작동하는 반면, 부분 변이 중에는 단순 재시도, 호출별 동일성(per-call idempotency), 제로 권한 저널링(zero-privilege journaling)이 평가된 복합 워크플로우에서 실패합니다. 커밋 후 인식 전에는 검증(verification)과 서버 측 동일성이 안전성을 상당히 향상시킵니다. 이러한 발견은 명목적 완료만을 평가하는 것이 자율 에이전트의 결정적인, 단계 의존적 복구 취약점을 가린다는 것을 입증합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기