AgentTime: 에이전트가 자신의 실행 시간을 추정하고 제어할 수 있는가?
요약
본 글은 AI 에이전트에게 필수적인 시간 관리 능력인 '지속 시간 준수(duration-following)'를 테스트하기 위한 벤치마크, AgentTime을 소개합니다. 이 벤치마크는 코딩, 연구 등 다양한 태스크로 구성되어 있으며, 에이전트의 실행 시간 예측 및 제어 능력을 평가합니다. 실험 결과에 따르면, Claude Code와 Codex 같은 모델들은 요청된 시간을 맞추는 데 편차가 크거나, 시간이 제거되었을 때 성능 저하가 크게 나타나는 경향을 보였습니다.
핵심 포인트
- AgentTime 벤치마크를 통해 에이전트의 시간 인식 및 제어 능력을 평가함.
- Claude Code와 Codex 모델은 요청된 실행 시간을 맞추는 데 편차가 크다는 점이 확인됨.
- 시간 정보가 제거될 경우, 에이전트의 성능 저하 폭이 크게 나타나 장기적 신뢰성 확보가 중요함을 시사함.
AI 에이전트에게 필수적인 제어 능력 중 하나는 실행 시간(runtime)을 관리하는 능력입니다. 이 능력은 시간 인식(time-awareness)을 필요로 하며, 벽시계 시간(wall-clock time)을 예측하고 추정하며 자신의 행동을 제어할 수 있어야 합니다. 이전 연구들은 시간 인식에 초점을 맞추었지만, 지속 시간 준수(duration-following)와 네이티브 에이전트 하네스에서의 제어는 여전히 탐구되지 않은 영역입니다. 우리는 에이전트가 요청된 기간 동안 작업을 수행하고, 실행 시간을 예측하며, 이후 경과 시간을 추정할 수 있는지 테스트하기 위한 벤치마크인 AgentTime을 제시합니다. 이 벤치마크는 코딩, 컴퓨터 사용, 에이전트 작업(agentic work), 자동화된 연구 등 18개 출처의 222개 태스크로 구성되어 있습니다. 지속 시간 준수 실험에서는 얼마나 오래 작업할지 지정하는 단일 지침을 추가하며, 요청 범위는 약 1분부터 수일에 이릅니다. 이러한 지침에 대한 정확도는 상당히 다르게 나타납니다: Claude Code의 Fable 5.1은 요청된 실행 시간과 평균적으로 2.9$ imes$의 편차를 보이는 반면, Codex의 GPT-6 Astra는 1.2$ imes$로 그치고 있습니다. 하지만 요청된 실행 시간을 맞추는 것이 그 자체로 태스크에 대한 지속적인 작업을 보장하지는 않습니다. 전사 기록(transcripts)을 분류할 수 있는 158개의 Astra 실행 중 14개는 완료한 것처럼 보인 후 명시적으로 대기했습니다. 예측 실험에서는 예측이 자연스러운 실행 시간을 과대평가하는 경향을 보입니다. 회고적 실험에서는 Sol과 Astra의 경우 시간 정보를 제거했을 때 편차가 두 배 이상 증가하고, Fable의 경우 거의 두 배로 증가합니다. 에이전트가 태스크를 완료할 수 있는 능력이 그 자체로 자신의 시간을 제어하거나 요청된 전체 기간 동안 작업할 수 있다는 것을 보장하지는 않습니다. 에이전트가 장기적인 관점에서 신뢰성 있게, 안전하게, 자율적으로 작동하려면 이 두 가지 모두에 대한 평가가 필요합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기