19:05에 에이전트는 무엇을 볼 수 있었을까? 실제 연구로부터 시간적 기업 시나리오를 생성하고 이를 재생하여 에이전트를 평가하기
요약
기업용 AI 에이전트 평가 시 발생하는 정적 스냅샷의 한계를 극복하기 위한 새로운 평가 시스템을 제안합니다. 실제 연구 데이터를 기반으로 시간 흐름에 따라 변화하는 기업 환경을 생성하고, 특정 시점의 데이터를 재현하여 에이전트의 성능을 정밀하게 검증합니다.
핵심 포인트
- 정적 스냅샷 기반 오프라인 평가의 한계 지적
- 시간적 진화가 가능한 기업 환경 생성 및 재생 기술
- 스키마 추론형 기술을 통한 과거 상태 재구축
- 차이 캐시(difference cache)를 활용한 빠른 평가 속도 구현
기업용 AI 에이전트 (Enterprise AI agents)는 데이터가 지속적으로 변화하는 수많은 앱에 걸쳐 활동하므로, 답변의 정답 여부는 질문이 던져진 순간에 어떤 데이터가 존재했는지와 누가 그것을 볼 수 있었는지에 따라 결정됩니다. 오늘날의 오프라인 평가 (Offline evaluation) 방식은 단일한 정적 스냅샷 (static snapshot), 즉 에피소드의 종료 시점을 기준으로 점수를 매깁니다. 따라서 에피소드의 이전 모든 순간이 각기 다른 정답을 가진 현실적인 질문을 유도하는 별개의 상황임에도 불구하고, 오직 하나의 상황, 즉 최종 상황만을 평가할 수 있습니다. 이러한 각 순간을 별도의 스냅샷으로 재현하는 것은 매 순간마다 전체 테넌트 (tenant)를 다시 프로비저닝 (re-provisioning)해야 함을 의미하며, 이는 비용이 지나치게 많이 듭니다. 또한 단일 스냅샷조차 기록 내부에 숨겨진 미래 상태를 유출하며, 실제 업무가 발생하는 멀티 앱 (multi-app) 및 시간 순서에 따른 방식을 표현할 수 없습니다. 우리의 시스템은 두 가지 격차를 동시에 해소합니다. 즉, 실제 연구로부터 현실적이고 페르소나 중심적이며 시간적으로 진화하는 기업 환경을 생성하고, 선택한 어느 시점에서든 해당 환경을 재생하여 교체 가능한 에이전트 (pluggable agent)를 평가합니다. 스키마 추론형 시간적 기술 (schema-inferred temporal description)은 각 레코드의 과거 상태를 결정론적 방식과 LLM을 결합하여 재구축하도록 유도합니다. 쿼리가 가능한 순간들이 유한하기 때문에, 모든 재구축 과정은 컴팩트한 차이 캐시 (difference cache)로 사전 계산되어, 모델을 거치지 않고도 평가를 빠르고 재현 가능한 조회 (lookup) 작업으로 만듭니다. 우리는 설계 방식, 두 흐름을 아우르는 아키텍처, 그리고 기업용 에이전트를 평가한 초기 경험에 대해 설명합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기