Google AI Edge Gallery에 MCP 추가: 이제 온디바이스 에이전트가 실제로 할 수 있는 일
요약
Google AI Edge Gallery가 Model Context Protocol(MCP) 지원을 추가하여 온디바이스 AI의 고립 문제를 해결했습니다. 이를 통해 Gemma 4 모델은 기기 외부로 데이터를 유출하지 않고도 로컬에서 도구를 결정하고 API 호출을 통해 캘린더, 지도, 웹 등 외부 서비스와 상호작용할 수 있는 실제 에이전트 역할을 수행할 수 있습니다.
핵심 포인트
- MCP 통합을 통해 온디바이스 모델이 앱 샌드박스를 넘어 외부 도구 및 리소스에 접근 가능해짐
- 사용자의 원시 쿼리 대신 구조화된 API 호출만 네트워크로 전송하여 개인정보 보호 유지
- LiteRT-LM 백엔드의 빠른 프리필 기능을 통해 긴 채팅 기록과 컨텍스트를 즉각적으로 재구성
- Android 전용 실험적 기능으로 현재 Streamable HTTP를 통해 구현됨
온디바이스 AI (On-device AI)는 그동안 데모에서는 인상적이었지만, 그 외의 모든 곳에서는 제한적인 모습을 보이며 대부분의 시간을 보냈습니다. Google은 가장 중요했던 제약 사항을 방금 변경했습니다. 바로 모델이 앱 샌드박스 (app sandbox) 외부의 어떤 것에도 도달할 수 없었다는 점입니다.
해결하려는 문제
로컬 추론 (Local inference)은 개인정보 보호와 지연 시간 (latency) 측면에서는 훌륭합니다. 하지만 유용성 측면에서는 형편없습니다. 휴대폰에서 완전히 실행되는 모델은 학습 데이터로부터 질문에 답할 수는 있지만, 그 외에는 아무것도 할 수 없습니다. 캘린더, 편지함, 실시간 웹, 외부 도구 등에 접근할 수 없습니다. 주변 세계에 작용할 수 없는 고립된 추론 엔진을 갖게 되는 것입니다. 이것이 엣지 AI (edge AI)의 근본적인 긴장 상태입니다. 모델을 외부 시스템에 연결하는 순간, 일반적으로 요청을 서버를 통해 라우팅하게 됩니다. 그러면 개인정보 보호라는 명분은 무너집니다. 지연 시간은 늘어납니다. 오프라인 기능은 사라집니다.
Google AI Edge Gallery는 방금 이에 대한 해답을 내놓았습니다. 5월 19일 업데이트를 통해 Android 앱에 예약된 알림 리마인더 및 지속적인 채팅 기록과 함께 모델 컨텍스트 프로토콜 (Model Context Protocol, MCP) 지원이 추가되었습니다. 이 세 가지 기능이 결합되어, 이 앱은 단순한 모델 놀이터에서 실제 온디바이스 에이전트 런타임 (on-device agent runtime)처럼 보이기 시작하는 단계로 넘어갑니다.
실제 작동 방식
MCP 통합은 Streamable HTTP를 통해 실행되며, 현재 실험적 단계이며 Android 전용입니다 (iOS 지원 예정). 이 아키텍처는 여러분이 예상하는 것과 다를 수 있으므로 주의 깊게 이해할 가치가 있습니다. 앱에서 MCP 서버 URL을 등록하면, 앱은 도구 정의 (tool definitions)와 리소스 스키마 (resource schemas)를 직접 가져와 온디바이스 상의 Gemma 4 시스템 프롬프트 (system prompt)에 동적으로 삽입합니다. 추론은 전적으로 휴대폰에서 이루어집니다. Gemma 4는 로컬에서 어떤 도구를 호출할지 결정하고, 로컬에서 요청을 생성한 다음, 해당 요청을 MCP 서버가 위치한 곳(집에 있는 컴퓨터, 클라우드 엔드포인트 등 어디든)으로 보냅니다. 모델 자체는 절대 기기를 떠나지 않습니다. 이는 의미 있는 아키텍처적 선택입니다. 도구 선택 및 오케스트레이션 (orchestration) 로직이 비공개로 유지됩니다.
네트워크를 통해 전송되는 것은 구조화된 API 호출뿐이며, 사용자의 원시 쿼리(raw query)나 모델이 작업 중이던 컨텍스트(context)는 전송되지 않습니다. 알림 시스템은 다르게 작동합니다. 이는 로컬 OS 수준의 리마인더를 설정하는 "알림 예약 (Schedule Notification)" 스킬입니다. 알림을 탭하면 앱이 해당 도구로 직접 열리며 자동으로 Gemma 4 세션을 시작합니다. 서버는 전혀 관여하지 않습니다. 채팅 기록의 지속성(persistence)은 LiteRT-LM 백엔드의 빠른 프리필(prefill) 기능을 통해 실행됩니다. 최신 스마트폰 GPU에서 프리필은 초당 3,000 토큰 이상에 도달할 수 있으며, 이는 앱을 다시 열 때 모델이 긴 이전 세션을 거의 즉각적으로 재구성할 수 있음을 의미합니다. 세션은 텍스트, 이미지, 오디오 전반에 걸쳐 상태(state)를 유지합니다.
개발자들이 실제로 활용하고 있는 용도
Google이 시연한 MCP 유스케이스(use cases)는 추측이라기보다 실용적입니다. Google Workspace MCP에 연결하여 캘린더를 조회하거나 받은 편지함을 확인할 수 있습니다. Google Maps MCP를 사용하여 자연어로 이동 시간을 물어볼 수 있습니다. 웹 페치(web fetch) MCP를 연결하여 실시간 문서나 뉴스를 모델의 컨텍스트로 가져올 수 있습니다. 알림과 세션 연속성의 결합은 더욱 흥미로운 것을 가능하게 합니다. 바로 컨텍스트를 실제로 유지하는 예약된 루틴입니다. 매일 저녁 10시에 알림을 주고 Gemma 4를 실행하며, 채팅 기록이 유지되기 때문에 이전 기록을 살펴보고 트렌드를 파악할 수 있는 기분 추적(mood tracking) 워크플로우가 그 예입니다. 집을 나서기 전 로컬 캘린더를 읽고 요약을 제공하는 모닝 브리핑도 가능합니다. 사용자가 선택한 어떤 주제로부터든 공유 가능한 시각적 인포그래픽을 생성하는 일일 "새로운 것 배우기" 프롬프트도 있습니다.
GitHub Discussions 페이지의 커뮤니티 구축 스킬들은 이미 더 나아가고 있습니다. 실시간 날씨 및 환율 데이터를 위한 경량 웹 검색 통합, 이미지와 HTML을 시맨틱 검색(semantic search)을 위한 구조화된 데이터로 변환하는 파서(parser), 퀴즈 생성기, 언어 번역기, 오프라인 퍼즐 게임 등이 포함됩니다. 또한 Google은 채팅 설정에서 시스템 프롬프트(system prompt)를 직접 편집할 수 있는 기능을 추가했는데, 이는 개발자 대상 앱으로서 올바른 결정입니다.
설정 파일(config files)을 전혀 건드리지 않고도 페르소나(personas)를 정의하거나, 출력 제약 조건(output constraints)을 설정하고, 프롬프팅(prompting) 접근 방식을 실험할 수 있습니다. 이를 기반으로 구축하려는 분들을 위한 실질적인 참고 사항이 하나 있습니다. 온디바이스 모델(on-device models)은 서버 측 모델(server-side counterparts)보다 컨텍스트 윈도우(context windows)가 작습니다. Google은 MCP 도구 설명을 짧게 유지하고, 긴 텍스트 블록 대신 한입 크기의 데이터 스니펫(bite-sized data snippets)을 반환할 것을 명시적으로 권장합니다. 이 아키텍처는 간결하고 범위가 잘 지정된 도구 정의(tool definitions)에 유리합니다.
이것이 보기보다 더 중요한 이유
MCP는 2025년과 2026년 초 대부분을 엔터프라이즈 및 데스크톱 중심의 이야기로 보냈습니다. 툴링(tooling), 인프라(infrastructure), 논의 내용 모두 큰 컨텍스트 윈도우와 클라우드 컴퓨팅(cloud compute)에 접근할 수 있는 서버 측 에이전트(server-side agents)를 구축하는 개발자를 겨냥해 왔습니다. 완전히 온디바이스에서 실행되는 모델을 기반으로 MCP를 휴대폰 앱에 넣는 것은 이 프로토콜을 배포의 다른 범주로 이동시킵니다. 추론(reasoning)은 기기 내에서 이루어집니다. 오직 구조화된 도구 호출(structured tool calls)만이 네트워크를 통해 전송됩니다. 이는 의료 앱, 법률 도구, 또는 원시 쿼리 데이터(raw query data)가 기기를 떠날 수 없는 그 어떤 분야에서도 실행 가능한 아키텍처입니다.
또한 여기서 오픈 소스(open-source) 측면에서도 주목할 만한 점이 있습니다. Google AI Edge Gallery 저장소(repository)는 공개되어 있고, 스킬 시스템(skill system)은 확장 가능하며, 커뮤니티는 이미 이를 기반으로 구축하고 있습니다. 이는 승인된 통합 기능들이 큐레이션된 앱 스토어를 갖춘 폐쇄형 플랫폼이 아닙니다. 누구나 MCP 서버를 작성하고, 앱에 등록하며, 온디바이스 Gemma가 도달할 수 있는 범위를 확장할 수 있습니다. 지속적인 세션(persistent sessions), 선제적 알림(proactive notifications), 그리고 외부 도구 접근(external tool access)의 결합은 기본적으로 앰비언트 에이전트(ambient agent)의 최소 기능 정의(minimum viable definition)와 같습니다. 즉, 시간이 지나도 컨텍스트를 유지하고, 필요할 때 외부 시스템에 도달하며, 명시적으로 호출되지 않고도 행동할 수 있는 존재를 말합니다. Google은 이 세 가지를 한 번의 업데이트로 모두 제공했습니다.
가용성 및 액세스
MCP 통합은 현재 Google AI Edge Gallery의 Android 버전에서 라이브 상태입니다. iOS 지원은 곧 출시될 예정으로 명시되어 있습니다.
기술 문서와 예시 MCP 설정은 GitHub 리포지토리에서 확인할 수 있습니다. 해당 앱은 무료이며 Play Store와 App Store 모두에서 이용 가능합니다. 이는 Google I/O 2026의 일환으로 발표되었습니다. 자세한 내용은 io.google 에서 확인하십시오. 로컬에서 실행되는 Gemma 4, 외부 도구로 연결하는 MCP 브릿징, 빠른 프리필 (prefill)을 처리하는 LiteRT-LM으로 구성된 에지 AI 스택 (edge AI stack)은 이제 이를 기반으로 구축하고자 하는 모든 개발자가 사용할 수 있습니다. 흥미로운 질문은 커뮤니티가 Google이 아직 생각하지 못한 어떤 유스케이스 (use cases)를 찾아낼 것인가 하는 점입니다. MCP의 도달 범위가 이제 모든 Android 스마트폰으로 확장되었습니다. 이는 그 어떤 엔터프라이즈 배포 (enterprise deployment)와도 다른 표면적 (surface area)을 가집니다. MCP, 에이전틱 AI (agentic AI), 그리고 AI 인프라 (AI infrastructure)에 대한 더 많은 소식을 위해 팔로우해 주세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기