nanoMuse는 모델이 아닌 시스템: 여러 기기에서 개인 에이전트 구축하기
요약
nanoMuse는 단순한 언어 모델이 아닌, 여러 기기에서 지속적이고 책임감 있는 개인 에이전트를 구축하는 엔드투엔드 소프트웨어 시스템입니다. 이 시스템은 하나의 계정으로 여러 장치에 걸쳐 작동하며, 릴레이를 통해 대화를 공유하고 작업을 조정합니다. 이를 통해 사용자는 휴대폰과 컴퓨터 등 다양한 환경에서 일관된 AI 경험을 할 수 있습니다.
핵심 포인트
- nanoMuse는 모델이 아닌, 지속적인 에이전트 시스템 자체에 초점을 맞춥니다.
- 여러 장치(휴대폰, PC)를 하나의 개인 에이전트로 통합하여 사용성을 높입니다.
- 릴레이 메커니즘을 통해 대화와 작업을 여러 기기 간에 조정하고 공유합니다.
- Android는 proot 기반의 Alpine Linux 환경으로 온디바이스 기능을 구현했습니다.
지속적인 에이전트는 시스템의 문제
지속적인 개인 에이전트는 컨텍스트를 유지하고, 여러 장치에 걸쳐 작동하며, 애플리케이션에 도달하고, 인터페이스가 닫혀도 계속 작업하며, 중요한 행동에 대해 책임질 수 있어야 합니다.
이것이 Guangyi Liu, Yong Liu, 그리고 Jiangning Zhang이 작성한 nanoMuse의 2026년 10월 6일 논문의 배경입니다. nanoMuse는 또 다른 언어 모델로 제시되는 것이 아니라, 모델을 교체할 수 있는 엔드투엔드 소프트웨어 시스템으로 제시됩니다.
Meta Muse Glimmer-30B와 같은 모델 중심 프로젝트와 달리, nanoMuse는 주변 장치(machinery)를 제공합니다: 지속적인 아이덴티티, 실행 환경, 라우팅, 메모리, 인터페이스, 스케줄, 그리고 승인 경계입니다.
완전한 구현은 공식 nanoMuse 저장소에서 공개되었습니다.
아키텍처: 하나의 계정, 여러 에이전트
nanoMuse는 사용자의 관점에서 하나의 개인 에이전트를 설명하지만, 각 장치는 자체적인 에이전트 런타임을 실행합니다. 로그인 후, 이 런타임들은 릴레이를 통해 만나 대화를 공유합니다.
이러한 설계는 모든 휴대폰이나 컴퓨터를 단일 원격 가상 머신을 위한 얇은 터미널로 취급하는 것을 방지합니다. 휴대폰에서 작업을 입력하고 컴퓨터에서 실행할 수 있습니다. @Mac과 같은 대상으로 메시지를 접두사하면 해당 장치로 라우팅되며, 승인 요청은 사용자가 현재 들고 있는 장치로 돌아올 수 있습니다.
릴레이는 대화 텍스트를 전달하고 장치를 조정하며, 파일과 스크린샷은 생성된 위치에 남아 있습니다. 프로젝트의 커뮤니티 인프라 또는 사용자 제어 서버를 사용할 수 있습니다.
이 경계는 자동적인 개인 정보 보호 보장이 아닙니다. 셀프 호스팅(Self-hosting)은 메시지 라우팅을 제어하지만, 외부에서 호스팅되는 모델 제공업체는 여전히 모델 요청을 받을 수 있습니다. 릴레이 위치, 모델 위치, 장치 실행은 별개의 결정입니다.
기기 로컬 실행
휴대폰 및 데스크톱 런타임
Android에서는 nanoMuse가 APK 내부에 proot을 사용하여 Alpine Linux 환경을 구축하며, 여기에는 셸(shell), 브라우저, MCP 지원 및 스킬이 포함됩니다. 이 프로젝트는 온디바이스 에이전트의 기반으로 OpenMinis를 언급합니다.
데스크톱에서는 nanoMuse가 화면 조작 기능을 위해 Python 런타임을 사용하는 DeepSeek Harness를 사용합니다. 데스크톱 애플리케이션은 Windows, macOS 및 Linux를 목표로 합니다. 더 넓은 프로젝트에는 iPhone, iPad 및 브라우저 클라이언트도 포함되지만, 저장소의 비교표에 따르면 iOS에서는 화면 기반의 “손” 기능이 사용할 수 없다고 명시되어 있습니다.
이러한 런타임 덕분에 시스템은 단순한 채팅 인터페이스 이상의 기능을 제공합니다. 에이전트는 Linux 셸, 브라우저, MCP 서버 및 애플리케이션별 스킬을 사용할 수 있습니다. 또한 루틴을 예약하고, 목표를 확인하며, 보이는 애플리케이션이 닫혀 있는 동안 피드를 생성할 수도 있습니다.
리레이(The Relay)는 실행이 아닌 조정입니다
리레이는 장치들을 연결하여 서로 작업을 요청하게 하지만, 실제 실행은 여전히 특정 장치 런타임 또는 구성된 서버 환경과 관련되어 있습니다.
연결되지 않은 장치는 라우팅된 작업을 수신하지 못할 수 있으며, 로컬 셸은 리레이 경로 없이는 원격으로 접근할 수 없습니다. 조정 기능을 개인 서버로 옮긴다고 해서 모든 의존성이 로컬이 되는 것은 아닙니다.
검사 가능한 메모리(Memory You Can Inspect)
nanoMuse는 자신의 정체성, 사용자 지식 및 웨이크 스케줄을 Markdown 파일에 저장합니다. 사용자는 완전히 불투명한 메모리 저장소에 의존하기보다 해당 파일을 직접 검사하고 수정할 수 있습니다.
그럼에도 불구하고 논문은 더 강력한 메모리 출처(memory provenance)를 로드맵 작업으로 다룹니다. 편집 가능한 Markdown 파일은 언제, 왜, 어디서 기억된 모든 진술이 유래했는지 설명하는 완성된 시스템은 아닙니다.
저장소에는 작동하는 시스템이 포함되어 있지만, 논문에서는 평가(evaluation), 출처(provenance), 그리고 개방형 화면 조작 모델을 지속적인 작업으로 식별합니다.
에이전트에게 “손” 주기
많은 애플리케이션은 적절한 API를 노출하지 않습니다. nanoMuse는 '핸즈(hands)'라는 방식으로 이러한 격차를 해소합니다. 이는 안드로이드 애플리케이션 및 데스크톱 창에 대한 화면 기반 작업을 의미합니다.
데스크톱 구현은 UI-TARS-desktop을 기반으로 하며, 다른 인정된 프로젝트들은 휴대폰 작동 구성 요소와 추적 기능을 기여했습니다. 화면 상호작용은 전용 통합이 없을 때 에이전트가 보이는 인터페이스를 통해 작업을 수행할 수 있게 합니다.
또한 불확실성을 도입합니다. 그래픽 인터페이스는 변경되며, 해당 프로젝트의 논문에는 '핸즈'에 대한 평가 스위트를 로드맵 작업으로 나열하고 있습니다. 현재 사용 가능한 자료만으로는 화면 작동이 모든 애플리케이션이나 워크플로우에서 균일하게 신뢰할 수 있음을 확립하지 못했습니다. 개발자는 이를 안정적인 API 계약과 동등한 것이 아니라, 관찰 및 복구가 필요한 실행 메커니즘으로 취급해야 합니다.
Sentinel 및 결과적 행동 (Consequential Actions)
모든 행동은 '센티넬(Sentinel)'을 통과하는 것으로 설명됩니다. 저장소에 따르면 nanoMuse는 삭제, 전송 또는 결제 전에 일시 정지하며, 승인은 한 번의 발생, 현재 채팅, 또는 항상로 범위가 지정될 수 있습니다.
비밀번호 및 인증 코드는 사용자가 직접 입력할 수 있도록 유지됩니다. 로그인이나 CAPTCHA는 사용자에게 반환될 수 있으며, 이후 '완료(Done)'를 선택하면 작업이 재개됩니다.
이러한 승인 모델은 프로젝트가 되돌리기 어렵다고 분류하는 행동 이전에 인간의 확인 지점을 마련합니다. 이는 위험을 제거하지 않습니다. 광범위한 '항상' 승인은 반복적인 중단을 더 큰 지속적 권한으로 교환하며, 셸 접근(shell access), 브라우저 제어, 화면 작동은 채팅만 할 때보다 더 넓은 잠재적 영향을 생성합니다.
이것들은 프로젝트가 설명하는 통제 장치일 뿐이며, 독립적인 보안 검증의 증거는 아닙니다. 이 시스템을 배포하는 사람은 릴레이 노출(relay exposure), 제공업체 선택(provider selection), 기기 권한(device permissions), 승인 범위(approval scope) 및 에이전트가 개인 인터페이스를 작동시킬 때 발생할 수 있는 결과를 평가해야 합니다.
실제로 공개되고 자체 호스팅 가능한 것은 무엇인가?
저장소에 따르면 휴대폰 앱, 데스크톱 앱, 웹 콘솔, 그리고 릴레이는 GPL-3.0-or-later 하에 포함됩니다. 사용자는 자체 릴레이를 실행하거나, 자신만의 모델 제공자 키를 사용하거나, 웹 애플리케이션을 위한 사용자 지정 런타임을 구성할 수 있습니다.
이는 상당한 시스템 수준의 개방성을 의미하지만, 모든 가능한 배포가 완전히 로컬이라는 뜻은 아닙니다. 커뮤니티 릴레이는 모델 사용 허용이 있는 호스팅 서비스이며, 지원되는 많은 모델 선택지는 외부 제공자들입니다. 모델 자체는 하나의 필수적인 오픈 구성 요소로 제공되기보다는 의도적으로 교체 가능합니다.
해당 논문은 또한 화면 작동을 위한 오픈 모델, 출처 인식 메모리(provenance-aware memory), 그리고 수동 평가 스위트(hands evaluation suite)를 로드맵에 포함하고 있습니다. 이러한 항목들은 주변 애플리케이션과 릴레이가 사용 가능하다고 해서 완료된 것으로 보고되어서는 안 됩니다.
개발자가 주목해야 할 이유
nanoMuse는 종종 모델 선택 문제로 축소되는 문제에 대한 구체적인 아키텍처를 제공합니다. 영속적인 에이전트(Persistent agents)는 또한 라우팅, 장치 식별자, 로컬 실행, 메모리 형식, 승인, 스케줄링, 그리고 API가 없는 인터페이스를 위한 폴백(fallbacks)을 필요로 합니다.
개발자는 대화 텍스트가 어디를 이동하는지, 파일이 어디에 남아 있는지, 어떤 장치가 작업을 실행하는지, 사용자가 무엇을 편집할 수 있는지, 언제 승인이 필요한지 등을 검사할 수 있습니다.
nanoMuse는 개인 장치 접근으로 인해 제기되는 신뢰성 또는 보안 문제를 해결하지 않습니다. 대신 모델 계층을 넘어 그러한 질문들을 검토할 수 있는 개방적이고 자체 호스팅 가능한 시스템을 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기