진화하는 엔터프라이즈 AI 에이전트 스킬을 위한 연속적인 프로세스 레벨 평가
요약
본 논문은 엔터프라이즈 AI 에이전트의 스킬이 변화함에 따라 발생하는 행동 변화를 포착하기 위한 연속 평가 프레임워크를 제시합니다. 이 프레임워크는 결과 수준과 프로세스 수준 검사를 결합하여 툴 선택, 인자, 실행 순서 등 전 과정의 정확성을 평가하며, 실제 환경에서의 에이전트 신뢰성 확보에 기여할 것으로 기대됩니다.
핵심 포인트
- 결과와 과정을 모두 평가하는 연속적 프레임워크 제시
- 프로세스 레벨 검사를 통해 행동 변화(drift) 감지 가능
- 툴 선택, 인자, 실행 순서 등 전 과정의 정확도 측정
- 실제 API 진화 환경에서의 종단 검증이 필요함
엔터프라이즈 AI 에이전트의 스킬은 툴 API, 모델 및 사양이 변경됨에 따라 진화하지만, 최종 출력(final-output) 평가는 프로세스 레벨의 행동 변화(behavioral drift)를 놓칠 수 있습니다. 우리는 엔터프라이즈 가치 인식 복원력 시스템(enterprise Value Aware Resiliency system)에서 비즈니스 가치 결정(Business Value Determination) 스킬의 수익성 및 생산성 변형에 적용되는, 결과 수준(outcome-level)과 프로세스 수준 검사를 결합한 연속 평가 프레임워크를 제시합니다. 이 프레임워크는 실행당 정답(per-run ground truth)을 독립적으로 계산하고, 재사용 가능한 템플릿 테스트를 구현하며, 프로그램적 검사 및 범위가 좁은 LLM 심판(LLM judge)을 통해 툴 선택, 인자(arguments), 실행 순서, 데이터베이스 무결성을 평가합니다. 우리는 두 가지 스킬, 두 가지 사양 변형, 두 가지 에이전트 하네스, 세 가지 모델에 걸쳐 총 240회의 시도를 평가했습니다. 모든 적용 가능한 최종 수치 검사를 통과한 175회의 시도 중 162회(92.6퍼센트; Wilson 95 퍼센트 신뢰구간: 87.7-95.6 퍼센트)에서 또 다른 평가자 감지 편차(evaluator-detected deviation)가 발견되었습니다. 더 광범위한 일곱 가지 검사 최종 상태 정의 하에서도, 통과한 164회의 실행 중 151회(92.1퍼센트; 95 퍼센트 신뢰구간: 86.9-95.3 퍼센트)가 여전히 궤적 검사(trajectory check)를 위반했습니다. 의존성 기여도(Dependency attribution)는 실행당 평균 실패 검사를 6.34개에서 2.65개로 줄였습니다. 사양 민감도는 모델 및 하네스에 따라 달라졌으며, 세 가지 수익성 비교와 세 가지 생산성 비교 중 한 가지를 제외하고 모든 경우에 탐색적 부트스트랩 상호작용 구간이 0을 포함하지 않았습니다. 실행 시간으로 해결된 템플릿은 평가된 구성 전반에 걸쳐 재사용 가능한 회귀 커버리지(regression coverage)를 제공했으며, 실제 API 진화 하에서의 종단 검증(longitudinal validation)은 향후 과제입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기