
Doubao vs Mobilerun: 어떤 것이 더 나은가?
요약
모바일 앱을 직접 조작하는 AI 에이전트 구현 방식인 Doubao와 Mobilerun을 비교 분석합니다. Doubao는 OS에 통합된 전용 스마트폰 형태를, Mobilerun은 개발자를 위한 인프라 플랫폼 형태를 취합니다.
핵심 포인트
- Doubao는 AI가 OS에 깊이 통합된 에이전트 우선 스마트폰 방식임
- Mobilerun은 다양한 AI 모델을 모바일 기기에 연결하는 인프라 제공
- 두 제품 모두 API 의존 없이 화면 인식 및 조작을 목표로 함
- 사용 대상에 따라 하드웨어 통합형과 개발자 플랫폼형으로 구분됨
스마트폰을 조작할 수 있는 AI 에이전트(AI agents)를 구축하려는 경쟁이 가속화되고 있습니다. 이러한 에이전트들은 API나 앱 통합에 의존하는 대신, 화면을 읽고, 버튼을 탭하고, 텍스트를 입력하며, 다단계 워크플로우(multi-step workflows)를 탐색하는 등 인간과 동일한 방식으로 모바일 앱과 상호작용합니다.
매우 다른 접근 방식을 취하고 있는 두 제품은 ByteDance의 Doubao AI Phone과 Droidrun이 개발한 모바일 AI 에이전트 인프라(mobile AI agent infrastructure)인 Mobilerun입니다.
두 제품 모두 동일한 문제를 해결하는 것을 목표로 하지만, 서로 다른 대상(audiences)을 위해 설계되었습니다.
Doubao는 AI를 긴밀하게 통합된 경험을 제공하는 전용 스마트폰에 패키징합니다. Mobilerun은 개발자가 물리적 전화기든 클라우드 전화기(cloud phones)든 상관없이 AI 모델을 Android 또는 iOS 기기에 연결할 수 있도록 하는 인프라를 제공합니다.
우리는 각 제품이 어디에서 잘 작동하고 어디에서 여전히 어려움을 겪는지 이해하기 위해 일련의 실제 작업(real-world tasks)을 통해 두 가지 접근 방식을 테스트하는 데 시간을 보냈습니다.
동일한 문제에 대한 두 가지 서로 다른 해답
Doubao와 Mobilerun은 모두 단순한 질문에 답하려고 노력하고 있습니다: AI 에이전트가 항상 사용 가능한 것은 아닌 API 엔드포인트(api endpoints)에 의존하는 대신, 화면을 읽고, 탭하고, 타이핑하고, 다단계 작업을 수행하는 등 사람이 하는 것처럼 전화기의 앱을 조작할 수 있는가?
차이점은 문제를 접근하는 방식에 있습니다:
Doubao는 운영 체제(operating system)를 통해 문제를 해결합니다. AI는 에이전트 우선 경험(agent-first experience)을 중심으로 설계된 전용 스마트폰에 깊이 통합되어 있습니다.
Mobilerun은 인프라를 통해 문제를 해결합니다. 전화기를 출시하는 대신, 개발자가 Claude, Hermes 또는 OpenClaw와 같은 AI 모델을 Android 또는 iOS 기기에 연결하고 모바일 워크플로우(mobile workflows)를 자동화할 수 있는 플랫폼을 제공합니다.
빠른 기능 비교
| 기능 (Feature) | Doubao AI Phone | Mobilerun |
|---|---|---|
| 제품 유형 (Product Type) | AI 기반 스마트폰 (AI-powered smartphone) | 모바일 AI 에이전트 인프라 (Mobile AI agent infrastructure) |
| ... |
Doubao의 작동 방식
Doubao AI Phone에서 가장 먼저 눈에 띄는 것은 전용 AI 버튼입니다. 이 버튼을 누르면 어시스턴트가 즉시 나타나 작업을 수행할 준비를 마칩니다. 어시스턴트는 앱을 열고, 인터페이스를 탐색하며, 텍스트를 입력하고, 여러 화면을 자율적으로 이동합니다. 이 경험은 업무를 어시스턴트에게 위임하는 것과 훨씬 더 유사하게 느껴집니다.
Mobilerun의 작동 방식
전용 하드웨어를 요구하는 대신, 기존 모바일 기기에 AI 모델을 연결합니다. 사용자는 다음 중 하나를 선택할 수 있습니다:
- 원격으로 확장 가능한 자동화(remote scalable automation)를 위해 자신의 Android, iPhone 또는 클라우드 폰(Cloud phones)을 연결하거나,
- 원격 자동화를 위해 클라우드 폰을 실행할 수 있습니다. AI는 인터페이스를 관찰하고 사용자를 대신하여 동작을 수행함으로써 기기와 상호작용합니다. 소비자 중심의 어시스턴트와 달리, Mobilerun은 모바일 에이전트(mobile agents)를 위한 인프라 계층(infrastructure layer)입니다.
몇 가지 작업을 통해 Doubao와 Mobilerun을 비교해 보겠습니다:
아이스 아메리카노 주문하기: Doubao vs Mobilerun
Doubao에서: 저희는 Doubao에게 아이스 아메리카노를 주문하도록 요청했습니다. 어시스턴트는 배달 앱을 열고, 커피를 검색하고, 가격을 비교하고, 가장 저렴한 옵션을 선택한 뒤 주문을 완료하려고 시도했습니다. 과정 중에 명확한 설명이 필요한 경우 적절히 일시 중지하기도 했습니다.
전체 과정이 약 3분 정도 소요되긴 했지만, 워크플로(workflow)는 성공적으로 완료되었습니다. 전반적인 경험은 진행하기 전에 가끔 후속 질문을 던지는 주니어 어시스턴트에게 업무를 위임하는 것과 비슷하게 느껴졌습니다.
Mobilerun에서: Mobilerun을 사용하여 동일한 작업을 반복했습니다. 에이전트(agent)는 배달 애플리케이션을 열고, 아이스 아메리카노를 검색하고, 가능한 옵션들을 비교하고, 하나를 선택하여 장바구니에 담았습니다. 구매를 자동으로 완료하는 대신, 주문을 진행할지 아니면 장바구니에 그대로 둘지 물으며 일시 중지했습니다.
이러한 인간 참여형(human-in-the-loop) 워크플로는 금전적 결과가 따르는 작업을 수행하기 전에 추가적인 확인 단계를 제공합니다.
작업 2: 게시물에 댓글 달기
Doubao에서: 저희는 에이전트에게 Instagram 게시물에 댓글을 달라고 요청했습니다. Doubao는 텍스트를 반복해서 입력하고 삭제하다가 결국 포기했으며, 댓글 버튼을 식별하지 못했습니다. 이는 작지만 시사하는 바가 큰 실패입니다. 에이전트는 익숙한 인터페이스(surfaces)는 잘 다루지만, 확신을 가지고 위치를 찾을 수 없는 컨트롤(control) 앞에서는 멈춰버립니다.
Mobilerun에서: 그다음 Mobilerun을 사용하여 동일한 작업을 반복했습니다. 테스트 과정에서 에이전트는 성공적으로 게시물로 이동하여 요청된 댓글을 입력하고 제출했습니다.
이러한 결과에 기여했을 가능성이 높은 한 가지 요인은 Mobilerun이 인터페이스를 해석할 때 접근성 트리(a11y tree) 정보와 컴퓨터 비전(computer vision)을 결합하는 능력입니다. 이를 통해 많은 상황에서 실행 가능한 UI 요소를 더 안정적으로 식별할 수 있습니다.
작업 3: WeChat에서 친구와 채팅하기
Doubao에서: 마지막 테스트로, Doubao에게 WeChat을 열고 친구에게 메시지를 보내도록 요청했습니다. 테스트 중에 워크플로는 성공적으로 완료되지 않았습니다.
공개된 보고서들에 따르면, Doubao AI Phone과 WeChat을 포함한 일부 주요 중국 애플리케이션 간의 호환성 문제가 지적되었으나, 정확한 원인은 공개적으로 완전히 밝혀지지 않았습니다. 일부 애플리케이션은 (보안 문제로 인해) Doubao가 작업을 자동화하는 것을 차단한 것으로 보고되었습니다.
Mobilerun의 경우: 우리는 Mobilerun을 사용하여 동일한 작업을 반복했습니다. 이번에는 에이전트 (Agent)가 문맥을 이해하고, WeChat을 열어 친구와 채팅을 나누었습니다. 이 작업에서도 Mobilerun 에이전트는 성공적으로 임무를 수행한 반면, Doubao는 어려움을 겪었습니다.
이러한 작업들이 시사하는 점
Doubao는 진정한 이정표입니다: 사용자의 기기에 통합된 최초의 에이전트 주도형 (Agent-led) 스마트폰입니다.
약속된 기본적인 기능조차 제대로 수행하지 못해 비틀거렸던 Rabbit R1과 같은 초기 시도들과 달리, Doubao는 오늘날 바로 구매할 수 있는 기기에서 에이전트를 통해 음식 주문, 팟캐스트 재생, 앱 탐색과 같은 실제 엔드 투 엔드 (End-to-end) 워크플로를 완전히 완료합니다. 하지만 Doubao는 이러한 작업들을 독립된 기기 경험으로서 실행하며, UI 요소를 파싱 (Parsing)하지 못하거나 앱의 방어 기제에 부딪히면 멈춰버립니다. 이는 에이전트 우선 (Agent-first) 폰이 가능하다는 것을 증명하기에는 충분할 만큼 잘 작동하면서도, 이 아이디어가 얼마나 더 나아가야 하는지를 보여줄 만큼 충분히 자주 실패합니다. 여전히 테스트 단계에 있는 것입니다.
Mobilerun은 동일한 문제를 기기가 아닌 하나의 레이어 (Layer)로 취급합니다. 모델 불가지론적 (Model-agnostic, OpenAI, Anthropic, Gemini, Ollama, DeepSeek 지원)이며 Android와 iOS, 개인용 휴대폰 또는 클라우드 폰 모두에서 실행되기 때문에, 특정 단말기나 특정 벤더의 추론 (Reasoning)에 얽매이지 않습니다. 인간 참여형 (Human-in-the-loop) 채팅 모델을 통해 사용자는 주문하기, 결제하기 등 중요한 행동에 대한 통제권을 유지할 수 있습니다. 또한 접근성 (a11y) + 비전 (Vision) 모드 + 더 나은 아키텍처 (Architecture) 덕분에 Doubao 에이전트가 포기해 버리는 "전송" 버튼 찾기와 같은 정확한 UI 순간들을 돌파할 수 있습니다.
Doubao는 당신이 직접 소유하는 제품인 반면, Mobilerun은 당신이 운영하는 인프라 계층 (infrastructure layer)입니다. 하지만 동일한 작업에 대해, 두 서비스는 같은 목적지로 향하는 두 갈래의 길을 제시합니다. 즉, 스마트폰을 직접 조작하는 대상이 아닌, 업무를 위임하는 대상으로 만드는 것입니다.
어떤 것을 선택해야 할까요?
만약 별도의 설정 없이 바로 사용할 수 있는 소비자 친화적인 AI 폰을 찾고 있다면, Doubao는 현재 이용 가능한 가장 매력적인 구현체 중 하나를 제공합니다.
만약 AI 에이전트 (AI agents)를 구축하거나, 모바일 워크플로우 (mobile workflows)를 자동화하거나, 스마트폰을 더 큰 AI 시스템에 통합하려 한다면, Mobilerun이 훨씬 더 많은 유연성과 인프라를 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기

