Imagine to Act: 이미지 편집 월드 모델을 활용한 고충실도 데이터 합성 및 확장 가능한 GUI 에이전트 학습
요약
본 논문은 고충실도 GUI 에이전트 학습의 어려움을 해결하기 위해, 픽셀 수준 이미지 편집 월드 모델을 활용한 데이터 합성 방법인 Infinite-Dreamer를 제안합니다. 이 방법은 GUI 전환을 이미지 편집 작업으로 간주하고 VLM을 통해 구조화된 변화(delta-text)로 설명하여 현실적인 스크린샷 전환을 합성합니다. 이를 통해 생성된 데이터를 기반으로 학습된 Infinite-Actor는 기존 모델 대비 다양한 벤치마크에서 성능 향상을 입증했습니다.
핵심 포인트
- GUI 에이전트 학습의 핵심 난제: 고충실도 시각-행동 데이터 확보
- Infinite-Dreamer: 이미지 편집 월드 모델 기반의 합성 데이터 생성 방법론 제시
- VLM을 활용하여 UI 변화를 구조화된 델타 텍스트로 설명 가능
- 합성 데이터를 이용한 Infinite-Actor는 기존 SOTA 대비 성능 향상 입증
그래픽 사용자 인터페이스(GUI) 에이전트는 다양한 애플리케이션 전반에 걸쳐 복잡한 디지털 워크플로우를 자동화하는 유망한 패러다임으로 부상했습니다. 그러나 고도로 유능하고 일반화 가능한 에이전트를 학습시키기 위해서는 대규모의 고충실도(high-fidelity) 시각-행동 궤적(visual-action trajectories)에 근본적으로 의존하는데, 이는 확보하기가 매우 어렵습니다. 인간의 시연은 확장성이 떨어지며, 기존 GUI 월드 모델은 아이콘이나 레이아웃 스타일과 같은 중요한 픽셀 수준의 시각적 세부 사항을 버리고 텍스트 설명이나 HTML 렌더링에 의존합니다. 이 문제를 해결하기 위해, 우리는 픽셀 수준의 이미지 편집 월드 모델(Image Editing World Model)을 기반으로 하는 시뮬레이션 없는 데이터 합성 방법인 Infinite-Dreamer를 소개합니다. GUI 전환을 이미지 편집 작업으로 개념화함으로써, 우리는 Vision-Language Models (VLMs)을 활용하여 행동 유발 UI 변화를 구조화된 델타 텍스트(delta-text)로 설명합니다. 그런 다음 이미지 편집 백본(backbone)을 미세 조정하여 현실적인 스크린샷 전환을 제어 가능하게 합성합니다. 우리는 이 모델을 사용하여 단일 프레임 시각적 견고성 데이터와 다단계 가상 궤적을 모두 생성합니다. 우리의 접근 방식의 효과를 검증하기 위해, 우리는 Qwen3-VL 기준선(baseline)을 오직 합성된 데이터에만 미세 조정하여 Infinite-Actor를 얻고, 이를 AndroidWorld, MobileWorld, 그리고 AndroidControl-Curated 벤치마크에서 평가했습니다. Infinite-Actor는 모든 규모에 걸쳐 Qwen3-VL 기준선을 일관되게 능가합니다: Infinite-Actor-8B는 AndroidWorld Pass@1을 +4.45 개선하고 MobileWorld Pass@3 성공률을 거의 두 배로 높였으며, Infinite-Actor-2B는 Pass@1을 +9.05 개선했습니다. 코드는 https://github.com/swaydy-n/Infinite-Dreamer에서 이용 가능합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기