로컬 컴퓨터 사용 에이전트(Computer-Use Agents)의 추론 시간 스케일링(Inference-Time Scaling) 재고: 실패
요약
로컬 환경에서 컴퓨터 사용 에이전트(CUA)의 추론 시간 스케일링 효과를 체계적으로 분석한 연구입니다. 문맥적, 시간적, 구조적, 병렬적 스케일링이 로컬 모델의 성능 향상에 미치는 한계와 수확 체감 현상을 실증적으로 규명했습니다.
핵심 포인트
- 추론 시간 스케일링이 로컬 CUA의 성능 향상에 항상 효과적인 것은 아님
- 문맥적 스케일링은 토큰 비용 증가에 따라 이득이 포화되는 경향을 보임
- 시간적 스케일링은 오류 궤적을 교정하기보다 오히려 연장시키는 부작용 발생
- 효율적인 로컬 에이전트를 위해 선택적 연산 할당 및 실패 인지 제어 메커니즘 필요
자율적인 컴퓨터 사용 에이전트(Computer-Use Agents, CUAs)를 로컬에 배포하는 것은 개인정보 보호, 비용 효율성 및 실질적인 사용성을 위해 점점 더 중요해지고 있지만, 엄격한 하드웨어 제약 조건 하에서 성능을 향상시키는 것은 여전히 어려운 과제로 남아 있습니다. 최근 연구들은 실행 중 추가적인 연산을 통해 추론 시간 스케일링(Inference-Time Scaling)이 최첨단 컴퓨터 사용 에이전트의 성능을 향상시킬 수 있음을 보여주지만, 자원이 제한된 로컬 모델에 대한 그 효과는 여전히 잘 알려져 있지 않습니다. 본 연구에서는 문맥적(contextual), 시간적(temporal), 구조적(structural), 그리고 병렬적(parallel) 차원에 걸쳐 로컬 CUA의 추론 시간 스케일링에 대한 체계적인 실증적 연구를 제시합니다. 우리는 OSWorld 벤치마크에서 Qwen3-VL-8B/30B-A3B, UI-TARS-1.5-7B, 그리고 OpenCUA-7B를 평가합니다. 연구 결과에 따르면, 추가적인 연산은 종종 수확 체감(diminishing returns)을 보이며 실패 모드(failure modes)를 변화시키는 것으로 나타났습니다. 문맥적 스케일링(Contextual scaling)은 궤적 안정성과 작업 정확도를 향상시키는 역사적 근거(historical grounding)를 제공하지만, 토큰 비용이 증가함에 따라 이득이 포화되며, 실패 양상이 반복되거나 정체된 궤적에서 조기 잘못된 성공(premature false successes)으로 이동합니다. 시간적 스케일링(Temporal scaling) 역시 최대 단계 정체(max-step stalls)를 줄여주지만, 작업 성공률을 실질적으로 개선하지는 못하며, 이는 더 긴 지평(longer horizons)이 오류가 있는 궤적을 교정하기보다는 오히려 연장시키는 경우가 많음을 시사합니다. 나아가 우리는 구조적 분해(structural decomposition)가 로컬 2단계 에이전트(two-stage agents)에서 계획 및 포맷팅 오버헤드(planning and formatting overhead)를 유발할 수 있는 반면, 병렬 스케일링(parallel scaling)은 상당한 연산 비용을 들여 이러한 실패를 부분적으로 완화한다는 것을 발견했습니다. 종합적으로, 우리의 연구 결과는 효율적인 로컬 CUA를 위해 선택적인 연산 할당(selective compute allocation), 실패 인지 제어 메커니즘(failure-aware control mechanisms), 그리고 로컬 모델의 역량과 한계를 중심으로 설계된 에이전트 프레임워크(agentic frameworks)가 필요함을 시사합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기