OmegaUse-OfficeVal: 경제적 근거를 바탕으로 한 장기적 오피스 스위트 작업에서의 LLM 에이전트 벤치마킹
요약
LLM 에이전트의 오피스 스위트 작업 수행 능력을 경제적 관점에서 평가하는 새로운 벤치마크 OmegaUse-OfficeVal을 소개합니다. 인간의 노동 시간과 비용을 기준으로 에이전트의 효율성과 가치를 측정하며, 오픈 소스로 공개되었습니다.
핵심 포인트
- 경제적 근거를 바탕으로 한 장기적 오피스 작업 벤치마크 제안
- 인간 노동 시간과 작업 가격 대리 지표를 통한 가치 평가 가능
- 코드 기반 검증기를 통한 안정적인 평가 체계 구축
- LLM 에이전트가 인간보다 빠르고 저렴하지만 품질은 아직 미달
대규모 언어 모델 (LLM) 에이전트가 사용자의 작업 완수를 돕는 역할에 대한 기대가 점점 커지고 있습니다. 그러나 기존의 벤치마크들은 에이전트가 합리적인 비용으로 오피스 스위트 (office-suite) 워크플로우를 수행할 수 있는지 평가하는 데 있어 제한적인 지원만을 제공합니다. 우리는 작업 수준의 경제적 근거 (economic grounding)를 바탕으로, 장기적 (long-horizon) 오피스 스위트 작업에서 LLM 에이전트를 평가하기 위한 벤치마크인 OmegaUse-OfficeVal을 소개합니다. 이 벤치마크는 실무자들이 제안한 오피스 스위트 요청에서 유도되고 개인정보 보호 프로세스를 통해 조정된 100개의 작업으로 구성됩니다. 평균적으로 이 작업들은 완료하는 데 2.32시간의 인간 노동력을 필요로 합니다. 이 벤치마크의 중요한 특징은 각 작업이 인간의 노동 시간과 작업 가격 대리 지표 (task price proxy)라는 두 가지 경제적 신호와 쌍을 이룬다는 점입니다. 이러한 신호들은 인간의 비용과 LLM 추론 (inference) 비용 간의 직접적인 비교뿐만 아니라, 가치 가중 평가 (value-weighted evaluation)를 가능하게 합니다. 안정적인 평가를 지원하기 위해, 우리는 세밀한 루브릭 (rubrics)으로부터 코드 기반 검증기 (code-based verifiers)를 개발했습니다. 우리는 여러 최첨단 (frontier) LLM들을 인간 기준점 (human baseline)과 함께 평가했습니다. 평가된 모든 LLM은 인간 작업자보다 훨씬 저렴하고 빠르지만, 아직 인간 수준의 결과물 품질에는 도달하지 못했습니다. 코드와 데이터셋은 완전히 오픈 소스로 공개되었으며, 더 자세한 정보는 프로젝트 웹사이트(https://omegause-officeval.github.io)에서 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기