
OSReward
요약
컴퓨터 사용 에이전트의 궤적을 평가하는 VLM 판사의 신뢰성을 테스트하기 위한 인간-골드 벤치마크인 OSReward를 소개합니다. 상용 모델 대비 비용을 30~60배 절감하면서도 성능이 일치하는 오픈 소스 보상 모델 OS-Shepherd를 제공합니다.
핵심 포인트
- 컴퓨터 사용 에이전트 평가를 위한 인간-골드 벤치마크 제공
- VLM 판사의 신뢰성 검증 및 성능 테스트 가능
- 상용 모델 대비 30~60배 저렴한 비용의 오픈 소스 보상 모델 제공
- OS-Shepherd 모델을 통한 효율적인 에이전트 학습 지원
OSReward
컴퓨터 사용 에이전트 (computer-use agent) 궤적을 점수화할 때 VLM 판사 (VLM judges)가 실제로 얼마나 신뢰할 수 있는지 테스트하기 위한 인간-골드 (human-gold) 벤치마크로, 상용 판사 대비 30~60배 낮은 비용으로 성능이 일치하는 오픈 소스 OS-Shepherd 보상 모델 (reward models)을 제공합니다. https://t.co/oi4LswtBx7
AI 자동 생성 콘텐츠
본 콘텐츠는 X @huggingpapers (검증됨)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기