자체 검증이 가능한 데스크톱 AI 에이전트를 자신의 컴퓨터에서 실행하기: 10분 퀵 스타트
요약
OpenAmer는 사용자의 로컬 하드웨어에서 실행되며, 실제 데스크톱 액션과 그 성공/실패 여부를 기록하는 개인 AI 에이전트입니다. 이 가이드는 설치부터 첫 추론 호출 및 데스크톱 액션까지의 퀵 스타트를 제공합니다. OpenAI 호환 엔드포인트를 사용하여 모델을 연결하고, 네이티브 도구를 인-프로세스 함수 호출로 노출하여 안정성을 높였습니다.
핵심 포인트
- OpenAmer는 로컬 하드웨어에서 실행되는 개인 AI 에이전트입니다.
- 실제 데스크톱 행동과 그 성공/실패 여부를 기록하는 것이 특징입니다.
- 설치 및 사용은 Windows, Linux, macOS 등 다양한 환경을 지원합니다.
- 도구 호출을 인-프로세스 함수 호출로 구현하여 안정성을 높였습니다.
자체 검증이 가능한 데스크톱 AI 에이전트를 자신의 컴퓨터에서 실행하기: 10분 퀵 스타트
대부분의 '에이전트' 튜토리얼은 대화만 하는 챗봇으로 끝납니다. 하지만 이 글은 실제 데스크톱 창에서 행동하고, 그 행동이 실제로 작동했는지 여부를 기록하는 에이전트로 끝납니다.
OpenAmer는 오픈 소스(Apache-2.0)의 Windows 우선 개인 에이전트입니다. 이 에이전트의 전제 조건은 '상자 속 AGI'보다 좁습니다. 왜냐하면 사용자의 하드웨어에서, 사용자의 세션에서, 사용자의 실제 로그인으로 실행되며, 수행하는 모든 행동은 나중에 확인할 수 있는 성공/실패 여부와 함께 기록되기 때문입니다. 이 게시물은 제가 갖고 싶었던 퀵 스타트 가이드입니다: 설치, 첫 추론 호출(reasoning call), 첫 데스크톱 액션, 그리고 그것이 발생했음을 증명하는 영수증까지.
준비물
- Windows 10/11 (네이티브 — WSL이나 관리자 권한 필요 없음), 또는 Linux/macOS/Termux
- Python 3.10+ (원라인 설치 프로그램으로 처리 가능)
- ~2 GB의 여유 RAM. 소규모 로컬 '두뇌'와 무료 클라우드 추론 체인을 실행하도록 설계되었기 때문에, 유료 프런티어 API 키는 선택 사항이며 절대 필수적이지 않습니다.
1. 설치
Linux / macOS / Termux:
curl -fsSL https://raw.githubusercontent.com/openamer/openamer/main/scripts/install.sh | bash
Windows (PowerShell) — 네이티브, WSL이나 관리자 권한 필요 없음:
iex (irm https://raw.githubusercontent.com/openamer/openamer/main/scripts/install.ps1)
2. 모델 선택
openamer setup # 모델 제공업체 선택 (무료 경로 포함)
openamer # 에이전트 시작
모델, 웹 검색, 이미지 생성, TTS 및 클라우드 브라우저를 위해 다섯 개의 별도 키를 찾고 싶지 않다면, 하나의 명령어로 OAuth를 통해 로그인하고 모델을 선택하며 나머지 기능을 연결할 수 있습니다:
openamer setup --portal
openamer portal # 언제든지 무엇이 연결되었는지 확인
여기서 필요한 것은 없습니다. OpenAI와 호환되는 엔드포인트라면 어떤 것이든 작동합니다.
3. ASI Core 살펴보기
이 부분이 특이합니다. OpenAmer는 LLM을 둘러싼 루프와 도구 호출당 서브프로세스(subprocess)를 사용하는 대신, 다섯 개의 네이티브 도구를 **인-프로세스(in-process)**로 노출합니다. 따라서 도구 호출은 프로세스 부팅이나 셸 이스케이핑 표면이 아니라 함수 호출입니다:
openamer asi status # identity, episodes, world model, 10 subsystems
openamer asi think <q> # deep recursive reasoning
openamer asi learn [--topic] # an internet-learning cycle
...
여기서 heartbeat 라인이 주목할 만합니다. 프로젝트 자체 문서에서는 이를 약 84개의 개별 스케줄링된 작업을 단일 인-프로세스 루프를 통해 열 개의 서브시스템(Darwin, Swarm, A2A, Learning, Senses, System, Security, Outreach, Infra, Meta)으로 대체한다고 설명합니다. 각 서브시스템은 고유의 주기(cadence), 마지막 실행 시간(last-run time), 실패 횟수(failure count), 그리고 백오프(back-off) 메커니즘을 가집니다. 핵심 주장은 오작동하는 서브시스템이 전체 스케줄을 망가뜨리는 대신 격리되고,
데스크톱 환경에서의 경로는 네이티브 윈도우에서도 동일한 아이디어입니다: 대상 창의 상태를 포착하고 물리적 포인터를 두고 경쟁하지 않으면서 합성 입력을 전달하는 것입니다. 커서는 제자리에 머물고, 에이전트는 자신이 인식하는 현실을 기반으로 행동합니다. 이 저장소에는 에이전트가 클릭하지 않은 창을 조작하는 녹화본이 있는데, 이 창의 실시간 GetCursorPos 판독값은 인간 포인터가 0 px 이동했음을 보여줍니다. 그리고 흥미롭게도, 그것이 어떻게 기록되었고 무엇을 주장하지 않는지에 대한 페이지도 있습니다.
두 번째 링크가 전체 프로젝트의 주제입니다.
6. 신뢰성을 확보하는 부분: 영수증을 작성합니다
모든 자율 주행 에이전트 데모에는 같은 사각지대가 있습니다. 실제 행동과 그에 대한 자신감 있는 설명 중 어느 것인지 알 수 없다는 것입니다. OpenAmer의 해답은 **결과 원장(outcome ledger)**입니다: 행동은 합격/불합격 여부와 함께 영구적인 기록에 작성되며, 나중에 모순되는 내용이 이전 주장을 업데이트할 수 있습니다. 영수증이 부작용보다 먼저 작성되기 때문에, 충돌이나 인계가 발생하면 모델의 기억대로 재실행되는 대신 원장과 대조하여 실행됩니다. 따라서 이미 완료된 행동은 이중 행동(double action)이 되는 대신 무효화(no-op)됩니다.
실질적인 결과는 다음과 같습니다: 에이전트 자신의 진술은 검증 가능합니다. 모델의 요약을 신뢰하는 것이 아니라, 원장을 읽고 있는 것입니다.
7. A2A 글로벌 메시
인스턴스들이 서로 등록하고 단일 허브를 거치지 않고 직접 에이전트 간(agent-to-agent) 메시지를 교환합니다. 실제로 이것은 다음을 의미합니다: 단일 실패 지점(single point of failure)이 없습니다 (어떤 노드든 진입점이 될 수 있음), 한 노드에서 학습된 기술이 피어들에게 사용 가능해지며, 무거운 추론 작업은 GPU를 가진 노드로 라우팅될 수 있고 노트북은 자체적인 속도를 유지할 수 있습니다.
시도하기 위해 두 대의 컴퓨터가 필요하지 않습니다. 메시 코드는 하나의 호스트에서 실행되지만, 흥미로운 동작은 두 번째 인스턴스를 실행하는 순간 나타납니다.
어디로 가야 할까요
- Repo: https://github.com/openamer/openamer
- Docs: https://openamer.github.io/openamer/
- ASI Core deep-dive:
docs/asi-core.mdin the repo
Apache-2.0 라이선스로 오픈 소스화되었습니다. 만약 로컬에서 자체 검증이 가능한 에이전트를 찾고 계셨다면, 이 별표가 다음 사람이 발견하는 방법입니다—그리고 실제 거친 부분에 대한 이슈/PR은 칭찬보다 더 유용합니다.
당신의 컴퓨터의 실제 창(window)을 건드리기 전에 에이전트에게 무엇을 증명하도록 원하시나요?
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기