
InAgent, OSWorld에서 90.2% 기록하며 최초로 90% 돌파
요약
InAgent가 OSWorld 벤치마크에서 90.2%의 성공률을 기록하며 최초로 90%를 돌파했습니다. 특히 시스템 레벨 작업에서 100%를 달성하며 OpenAI, Google, Anthropic의 기록을 경신했습니다.
핵심 포인트
- OSWorld 벤치마크에서 최초로 90% 이상의 성공률 달성
- 시스템 레벨 작업에서 100% 성공률 기록
- 모델 자체의 성능보다 하네스 엔지니어링(Harness engineering)이 성과를 주도
- 에이전트 성능이 모델의 순수 능력보다 도구 및 오케스트레이션에 의존함을 입증
InAgent는 OSWorld에서 90.2%를 기록하며 최초로 90%를 넘어섰고, 시스템 레벨 (system-level) 작업에서 100%를 달성하며 OpenAI, Google, Anthropic의 기록을 경신했습니다. 모델의 순수한 성능이 아닌 하네스 엔지니어링 (Harness engineering)이 이러한 결과를 이끌어냈습니다.
InAgent는 2026년 7월 OSWorld에서 90.2%를 기록하며, 90%를 상회하는 최초의 컴퓨터 사용 에이전트 (computer-use agent)가 되었습니다. 이 중국산 에이전트의 결과는 동일한 벤치마크에서 OpenAI, Google, Anthropic이 세운 공개 기록을 넘어섭니다.
주요 사실 (Key facts)
- 90.2% OSWorld 작업 성공률, 최초로 90% 돌파
- 시스템 레벨 (system-level) 작업에서 100% 성공
- OpenAI, Google, Anthropic 기록 경신
- 단일 실행 결과; 시드 변동성 (seed variance)은 공개되지 않음
- 하네스 엔지니어링 (Harness engineering)이 결과를 주도
Pandaily에 따르면, InAgent는 2026년 7월 OSWorld에서 90.2%의 작업 성공률을 기록하며 90%를 넘긴 최초의 컴퓨터 사용 에이전트가 되었습니다. 이 에이전트는 과거 프런티어 모델 (frontier models)들의 성능을 저하시켰던 카테고리인 시스템 레벨 (system-level) 작업에서 100%를 달성했습니다. OSWorld는 스크린샷과 키보드/마우스 동작을 통해 파일 작업, 웹 브라우징, 애플리케이션 제어 등 실제 세계의 컴퓨터 작업을 완료하는 에이전트의 능력을 측정합니다.
핵심 요약 (Key Takeaways)
- InAgent는 OSWorld에서 90.2%를 기록하며 최초로 90%를 넘어섰고, 시스템 레벨 (system-level) 작업에서 100%를 달성하며 OpenAI, Google, Anthropic의 기록을 경신했습니다.
- 모델의 순수한 성능이 아닌 하네스 엔지니어링 (Harness engineering)이 이러한 결과를 이끌어냈습니다.
하네스 (harness)가 중요한 이유
헤드라인 수치는 구조적인 이야기를 가리고 있습니다. 프런티어 모델 (frontier models) 간의 격차는 모델 주변의 스캐폴드 (scaffold)가 이제 벤치마크 순위를 결정할 정도로 좁혀졌습니다. 계획을 세우고, 검증하며, 오류로부터 복구하는 코드인 하네스 엔지니어링 (Harness engineering)이 새로운 AI 경쟁의 최전선이 되었습니다. InAgent의 90.2%는 일차적으로 모델의 승리가 아니라, 시스템의 승리입니다.
이는 2026년 8월 Supabase의 평가 (evals) 벤치마크가 보여준 결과와 일치합니다. 즉, 실제 환경에서의 에이전트 성능은 모델의 순수한 능력 (raw model capability) 보다 도구 (tooling) 및 오케스트레이션 (orchestration)을 더 많이 따릅니다. Claude Code가 그곳에서 보여준 강력한 성과는 단순히 Claude의 가중치 (weights) 때문이 아니라, 그 구조물 (scaffolding) 덕분이었습니다. InAgent는 더 어렵고 표준화된 벤치마크를 통해 이 패턴을 확인시켜 주었습니다.
기록 뒤에 숨겨진 숫자들

90.2%라는 수치는 단일 실행 (single run)을 나타냅니다. 출처에서는 시드 (seed) 간의 분산 (variance)을 공개하지 않았는데, 이는 확률적 샘플링 (stochastic sampling)이 결과값을 몇 퍼센트 포인트씩 변화시킬 수 있는 벤치마크에서 의미 있는 누락입니다. 소프트웨어 설치나 설정 구성과 같은 다단계 작업 (multi-step operations)을 요구하는 OSWorld의 시스템 수준 작업 (system-level tasks)은 대부분의 에이전트가 실패하는 지점입니다. 이 부분에서 InAgent가 기록한 100%가 더 인상적인 수치입니다.
이전의 OSWorld 공개 기록들은 90% 미만이었습니다. OpenAI, Google, Anthropic은 각각 컴퓨터 사용 에이전트 (computer-use agents)를 발표했지만, 그 어느 것도 이 임계값을 넘지 못했습니다. InAgent의 결과는 이 특정 지표에서 중국 연구소(Chinese lab)를 앞서게 만들었지만, 해당 벤치마크는 범위가 좁습니다. OSWorld는 데스크톱 작업 (desktop tasks)을 다룰 뿐, 해당 기업들이 경쟁하는 전체 엔터프라이즈 워크플로우 (enterprise workflows) 범위를 모두 포괄하지는 않습니다.
주목해야 할 점
InAgent가 시드 분산 (seed-variance) 데이터를 공개할지, 혹은 자사의 하네스 아키텍처 (harness architecture)를 상세히 설명하는 후속 논문을 발표할지 지켜봐야 합니다. 또한, OpenAI, Google, Anthropic이 향후 두 분기 내에 90% 이상의 OSWorld 점수로 대응하는지도 추적해야 합니다. 만약 그들이 대응한다면, 하네스 엔지니어링 (harness engineering)이 새로운 군비 경쟁 (arms race)임을 확인시켜 주는 계기가 될 것입니다.
출처: pandaily.com
원문은 gentic.news에 게시되었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기