
ActiveVision
요약
모델이 반복적인 관찰과 추론을 통해 새로운 시각적 증거를 탐색할 수 있는지 평가하는 새로운 벤치마크인 ActiveVision을 소개합니다. 현재 프론티어 모델들은 인간의 성능에 비해 매우 낮은 점수를 기록하며 시각적 탐색 능력의 한계를 보여줍니다.
핵심 포인트
- ActiveVision은 모델의 반복적 관찰 및 추론 능력을 테스트하는 벤치마크임
- 인간은 96.1%의 높은 해결률을 보이는 반면, 최상위 모델은 10.6%에 그침
- Claude 3.5 Sonnet(Fable 5로 추정)은 3.5%의 매우 낮은 점수를 기록함
ActiveVision
모델이 반복적으로 관찰하고, 추론하며, 새로운 시각적 증거를 탐색할 수 있는지 테스트하는 벤치마크 (benchmark)입니다. 인간은 96.1%를 해결합니다. 가장 뛰어난 프론티어 모델 (frontier model)은 10.6%를 기록했습니다. Claude Fable 5는 단 3.5%의 점수를 기록했습니다. https://t.co/DEvLA3DrZ8
AI 자동 생성 콘텐츠
본 콘텐츠는 X @huggingpapers (검증됨)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기