OSReward: 교차 플랫폼 컴퓨터 사용 보상 모델을 위한 표준화된 평가 체계 구축
요약
컴퓨터 사용 에이전트(CUA)의 성능을 평가하기 위한 표준화된 벤치마크인 OSReward를 제안합니다. VLM 판사의 신뢰성을 분석하고, 저비용으로 고성능 보상 신호를 제공하는 오픈 보상 모델 OS-Shepherd를 공개합니다.
핵심 포인트
- CUA 궤적 평가를 위한 고품질 벤치마크 OSReward 구축
- VLM 판사의 체계적인 관대함 편향(leniency bias) 발견
- 추론 주석 데이터셋 OS-Shepherd-100K 공개
- 상용 모델 대비 비용 효율적인 오픈 보상 모델 OS-Shepherd 학습
컴퓨터 사용 에이전트 (Computer-using agents, CUAs)는 디지털 세계 전반에서 빠르게 발전하고 있습니다. CUA 궤적 (trajectory)은 에이전트의 행동, 상태 및 추론을 기록합니다. 에이전트가 작업 지침을 완수했는지 확인하는 것은 CUA 평가, 데이터 큐레이션 (data curation) 및 강화학습 (reinforcement learning)의 핵심입니다. 사람이 직접 작성한 검증기 (verifiers)나 사람이 직접 수행하는 주석 작업 (annotators)으로는 이러한 검증을 대규모로 제공할 수 없기에, 이 분야는 CUA 궤적의 판사로서 시각-언어 모델 (vision-language models, VLMs)에 점점 더 의존하고 있습니다. 하지만 근본적인 질문이 오랫동안 검토되지 않았습니다: 이러한 VLM 판사들이 충분히 신뢰할 수 있는가? 이를 체계적으로 연구하기 위해, 우리는 CUA 궤적에 대해 VLM 판사를 평가하는 현실적이고 고품질인 벤치마크인 OSReward를 소개합니다. 이 궤적들은 다양한 에이전트 백본 (backbones)이 여러 플랫폼에서 사람이 검증한 지침을 실행한 결과이며, 다단계 인간 주석 작업을 통해 정답 판정 (ground-truth verdicts)이 엄격하게 라벨링되었습니다. 이를 바탕으로, 우리는 진정으로 어려운 사례에 집중하는 챌린지 세트인 OSReward-Hard와 세밀한 효율성 및 정렬 (alignment) 점수 산출을 위한 OSReward-Multi를 도출했습니다. VLM 판사에 대한 현재까지 가장 포괄적인 평가 결과, 최첨단 (state-of-the-art) 모델조차 이상적인 판사에는 미치지 못하며, 실패한 실행을 성공으로 잘못 라벨링하는 체계적인 관대함 편향 (leniency bias)을 공유한다는 것을 발견했습니다. 신뢰할 만큼 충분히 믿을 수 있는 소수의 모델은 대규모로 실행하기에 비용이 너무 많이 들며, 저렴한 오픈 모델들은 훨씬 뒤처져 있습니다. 이 격차를 줄이기 위해, 우리는 CUA 커뮤니티를 위해 추론 주석이 달린 궤적 판정 데이터인 OS-Shepherd-100K라는 오픈 코퍼스 (open corpus)를 구축하여 공개합니다. 이를 통해 우리는 최첨단 모델보다 30-60% 낮은 비용으로 상용 판사와 맞먹는 저비용, 안정적이며 신뢰할 수 있는 보상 신호를 제공하는 오픈 보상 모델인 OS-Shepherd (9B 및 35B)를 학습시킵니다. 광범위한 분석은 대규모에서 신뢰할 수 있는 CUA 보상을 설계하는 데 추가적인 정보를 제공합니다. 우리의 코드, 벤치마크, 데이터셋 및 모델 체크포인트는 https://os-copilot.github.io/OSReward-Home/ 에서 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기