
OpenClaw 설정은 인터넷에서 말하는 것처럼 간단하지 않습니다 – 저사양 하드웨어에서 로컬 AI 실행하기
요약
자율형 AI 에이전트 엔진인 OpenClaw를 저사양 미니 PC 환경에서 로컬로 실행하기 위한 설정 과정을 다룹니다. 클라우드 대신 로컬 실행을 선택했을 때의 메모리 조정 방법과 Gemma 4 모델 구동 시 발생하는 성능 한계를 분석합니다.
핵심 포인트
- OpenClaw는 파일 실행 및 웹 탐색이 가능한 자율형 AI 에이전트 엔진임
- 저사양 하드웨어에서 로컬 실행 시 비디오 메모리(VRAM) 확보가 필수적임
- Gemma 4 31B 모델을 로컬에서 구동 시 토큰 생성 속도 저하 문제 발생
- 모델 크기와 양자화 수준에 따른 하드웨어 메모리 대역폭의 중요성 확인
세상 돌아가는 소식에 어두운 사람이 아니라면, 2026년 초반 내내 OpenClaw가 긍정적이든 부정적이든 헤드라인을 장식하는 것을 보았을 것입니다. Peter Steinberger가 개발한 이 도구는 사용자를 대신해 자율적으로 행동할 수 있는 AI 에이전트 (AI agent)를 구동하는 엔진으로, 파일을 실행하고 웹을 탐색하는 등 훨씬 더 많은 일을 수행할 수 있는 능력을 갖추고 있습니다. “Skills”라고 불리는 시스템을 사용하여 AI 어시스턴트에게 새로운 작업을 수행하도록 가르칠 수도 있으며, 매일 더 많은 통합 기능이 등장하고 있습니다. 하지만 일반인에게 얼마나 유용할까요? 저는 OpenClaw가 사전 설치된 비교적 저사양인 Beelink SER10 MAX 미니 PC (mini PC)를 사용하여 이 질문에 대한 답을 직접 찾아보기로 했습니다.
시작하기에 앞서, OpenClaw 설치를 설정할 때 상당히 큰 결정 사항이 하나 있습니다. 클라우드 (Cloud) 리소스와 더 강력한 AI 모델에 의존할 것인가, 아니면 로컬 (locally)에서 실행할 것인가 하는 점입니다. Beelink의 SER10 MAX에는 비교적 오래되고 구형인 AI 모델인 Qwen-3.5 9B가 탑재되어 있습니다. 저는 상황을 상당히 단순하게 유지하고 싶었기에, 우선 로컬 AI 경로를 선택했습니다. 더 큰 모델을 실행하려면 많은 메모리 (memory)가 필요하므로, 먼저 이 저사양 미니 PC의 비디오 메모리 (video memory)를 48GB까지 조정했습니다. 이렇게 하면 더 크고 복잡한 모델을 메모리에 유지할 수 있을 것입니다. 또한 16GB의 시스템 메모리 (system memory)를 활용할 수 있게 되어, 터미널 (terminal)을 실행하고 다른 모든 것이 의도한 대로 작동하도록 보장하기에 충분할 것입니다.
이상적인 로컬 AI 모델 선택하기
48GB의 사용 가능한 비디오 메모리가 있다면 상당히 강력한 AI 모델을 시스템에서 실행할 수 있을 것입니다. 하지만 더 큰 모델을 구동하는 단점은 토큰 속도가 예상보다 약간 낮을 가능성이 있다는 점입니다. 그럼에도 불구하고, 우리를 위해 로컬에서 작동하는 초지능 AI를 구동하려면 가능한 한 많은 지능을 얻고 싶습니다. 이번 실습을 위해 저는 Google Gemma 4 31B (UD-Q8_K_XL)라는 모델을 선택했습니다. 이는 거의 손실이 없는 양자화(near-lossless quantization)이며, 제가 곧 배울 내용에 비추어 다소 야심 찬 선택입니다.
모델을 다운로드하고 llama.cpp에서 실행한 결과, 2.34 tok/s를 달성할 수 있었습니다. 평균적으로 일상적인 질의는 116개의 토큰이 필요했고, 속도는 2.34 tok/s였습니다. 이는 여전히 빠르고 일상적인 사용에는 너무 느립니다. 그래서 저는 심호흡을 하고, 보잘것없는 Ryzen AI 9 HX 470가 그렇게 큰 모델을 수용 가능한 토큰 속도로 구동하기에 충분한 메모리나 메모리 대역폭을 갖추지 못했음을 인정했습니다. 양자화를 4비트로 낮춘다고 하더라도, 특정 모델의 이론적 최대치는 여전히 약 5 tok/s 수준입니다. 만약 Framework Desktop과 같은 빠른 RAM 속도를 가진 더 빠른 기계가 있었다면 더 작업하기 쉬웠겠지만, 상대적으로 보잘것없는 DDR5-5600 속도의 저가형 실리콘으로는 조금 더 중화된 모델을 받아들여야 할 것입니다.
결국 저는 더 작은 Gemma 12B (Q4_K_M)이 이 정도 급의 장치에는 훨씬 합리적인 선택임을 인정했습니다. llama.cpp에 로드한 후, 일반 지식 질의인
제가 사용 중인 장치인 Beelink SER10 MAX에는 OpenClaw가 사전 설치되어 있습니다. 이 시스템의 유일한 실제 의존성(dependency)은 앞서 어떤 AI 모델을 사용할지 테스트하면서 설정했던 llama.cpp입니다. llama.cpp 포트가 공개되어 있기 때문에, OpenClaw는 그 모든 부가적인 화려한 기능들을 포함하여 AI 모델과 통신하는 데 이를 활용합니다. OpenClaw 설치 프로그램은 원격으로 AI 모델과 통신하기 위한 Telegram 채널을 설정하고, Ubuntu의 터미널 명령에 의존하지 않고도 설정을 구성할 수 있도록 게이트웨이(gateway)를 구성하는 등, 시스템을 가동하는 데 있어 상당히 직관적입니다.
설치 프로그램 내에서 우리는 새로운 AI 어시스턴트를 정의하기 시작합니다. SOUL.md라는 매우 거창한 이름의 파일을 통해, AI의 이름과 정체성, 사용자에 대한 몇 가지 기본 정보, 그리고 준수해야 할 원칙이 무엇인지 묻습니다. 기억하시겠지만, 우리의 '말하는 모래(talking sand)'는 살아있는 것이 아니므로 이 모든 과정은 상당히 극적입니다. 제가 HammerClaw라고 이름 붙인 우리의 겸손한 로컬 AI 모델이 SOUL.md 파일을 생성하는 데는 시간이 꽤 걸립니다. 하지만 이 모델이 이제 막 태동한 AI로서의 존재 가치를 증명할 만큼 유용한 일을 할 수 있을까요? 현재로서는 자신이 정확히 무엇인지, 무엇을 하고 있는지 생각하는 데에만 5분이 걸렸습니다.
잠시 후, 우리의 작은 HammerClaw가 "부화"하여 자신의 목적이 무엇인지, 제가 누구인지, 그리고 어떻게 말해야 하는지를 묻습니다. 개인적으로 저는 AI 모델이 장황하게 말하는 것을 좋아하지 않기 때문에, 핵심을 바로 짚고 말하며 절대로 저에게 거짓말을 해서는 안 된다고 설정했습니다. AI 모델이 이처럼 다소 사양이 낮은 장치로 확장될 수 있을 때, 크기가 작고 지능이 낮은 모델들은 오류를 범하기 쉽습니다. 우리의 작은 로컬 AI 에이전트가 활기차게 살아 움직이기 시작했으니, 이제 우리를 위해 작업을 자동화할 차례입니다. 그리 어렵지는 않겠죠... 맞죠?
장애물 (Stumbling blocks)
HammerClaw가 빠르게 깨어나자, 저는 작업을 하나 제안합니다. 신선도를 보장하기 위해 신뢰할 수 있는 매체로부터 하루 중 서로 다른 시간대에 작성된 뉴스 기사 10개를 수집하고, 발생한 사건들에 대한 짧은 요약(digest)을 만드는 것입니다. 제가 _Tom’s Hardware Premium_에서 수행하는 대부분의 작업이 칩 제조(chipmaking)와 데이터 센터(data centers)에 집중되어 있기 때문에, HammerClaw가 이 주제들에 초점을 맞추기를 원했습니다. 그러자 HammerClaw는 즉시 작업을 받아들여 이를 어떻게 수행할지 계산하기 시작합니다. HammerClaw는 내장된 cron 도구와 felo-search를 사용하여 인터넷에서 기사를 가져올 것입니다.
자, 바로 여기서 불쌍한 HammerClaw에게 문제가 발생합니다. 자동 스케줄링에 필요한 cron 작업(cron jobs)과 기술(skills)을 설정했다고 말했음에도 불구하고, 실제로 수행하는 대신 행동을 시뮬레이션하기 시작한 것입니다. 설상가상으로, 연결이 전혀 되지 않는 링크 목록을 환각(hallucination)하여 제시했습니다. 오류를 지적하자 HammerClaw는 사과하며 왜 일이 잘못되었는지 조사합니다. 알고 보니 몇 가지 추가적인 부분들을 설정해야 했고, HammerClaw는 이를 시도했지만 다시 한번 실패했습니다. 에이전트 도구 사용(Agentic Tool use)은 이제 하나의 구체적인 벤치마크(benchmark)가 되었지만, Gemma 4 12B에게 이와 같은 다단계 작업(multi-step task)을 설정하도록 요청했을 때, 모델은 제 프롬프트의 대화형 어조(conversational tone)를 감당하지 못하고 단순히 관리하는 데 실패했습니다.

OpenClaw

OpenClaw

OpenClaw
바로 이 시점에서 저는 HammerClaw에게 스스로 점수를 매겨보라고 요청했고, HammerClaw는 환각 (hallucination) 현상을 일으키고 가짜 뉴스를 만들어낸 것에 대해 정확도 측면에서 B-를 주었습니다. 물론 모든 OpenClaw AI 에이전트가 이럴 것이라고 말하고 싶지는 않습니다. 우리는 비교적 가벼운 로컬 모델 (local model)을 실행하고 있기 때문입니다. 모델 파라미터 수 (model parameter count)가 훨씬 더 많은 대규모 로컬 모델이라면 자신이 무엇을 해야 하는지 훨씬 더 효율적으로 식별할 수 있을 것이라 기대합니다. 이를 염두에 두고, 저는 다른 AI 모델이 HammerClaw의 이 작업을 조금이라도 도와줄 수 있을지 궁금해졌습니다. 그래서 저는 OpenRouter 계정에 접속하여 거대하고 강력한 2.8 Trillion Parameter Kimi K3와 채팅을 시작했습니다.
Kimi K3가 위기를 구하다
Kimi K3와 Gemma 4 12B 같은 클라우드 기반 프런티어 모델 (frontier model)을 비교하는 것은 공정하지 않습니다. 하나는 실행하는 데 테라바이트 단위의 RAM을 차지하는 반면, Gemma는 제 책상 위에 있는 미니 PC (Mini PC) 안에 들어갈 수 있기 때문입니다.
저는 Kimi K3를 AI 실행 자체에 사용하는 대신, HammerClaw가 수행할 능력이 없어 보였던 작업을 실제로 설정하는 데 도움을 달라는 임무를 맡겼습니다. 로컬 LLM (Large Language Model)을 클라우드의 더 강력한 모델과 병행하여 사용하는 이러한 하이브리드 워크플로 (hybrid workflow)는 많은 AI 애호가들이 사용하는 일반적인 설정입니다. 약 1달러 상당의 토큰 (tokens)을 사용한 후, Kimi K3는 OpenClaw CLI의 최신 문서를 읽어 모든 것을 정확하게 파악한 뒤 OpenClaw 명령어, 기술 (skills), 그리고 지침 목록을 보내주었습니다. 그것은 완벽했습니다. 저는 Kimi K3가 제공한 지침을 따라 Ubuntu 터미널 (Terminal)에 입력했고, 그 결과 HammerClaw를 위한 'News-Intel'이라는 이름의 새로운 기술이 성공적으로 생성되었으며, 웹 검색 기능을 활성화하는 방법과 자동 전송을 위한 크론 작업 (Cron jobs) 설정까지 완료되었습니다. 제가 OpenClaw를 이전에 사용해 본 적이 없다는 점을 고려하면, 로컬 모델이 이 모든 작업을 스스로 수행할 수는 없었음에도 불구하고 모든 과정이 놀라울 정도로 매끄러웠습니다.

(이미지 출처: OpenClaw)
모든 설정이 완료된 후, 나머지 작업을 실행하는 책임은 훨씬 더 겸손한 Gemma 4 12B 모델 기반의 HammerClaw로 넘어갔습니다. 결국 이것은 로컬 AI (Local AI) 모델들이 어떻게 작동하는지를 테스트하기 위한 것이니까요. 저는 운영 로그를 확인하면서 수동 실행 명령을 내렸고, 로그상에서 HammerClaw가 모든 도구 (tools)를 성공적으로 호출하는 것을 확인했습니다. 그리고 모든 역경을 딛고 HammerClaw가 실제로 해낼 수도 있겠다는 생각이 들었습니다. 몇 분 후, 저는 텔레그램 메시지를 받았습니다. HammerClaw가 작업을 로컬에서 실행하는 데 성공하여 10개의 뉴스 기사 요약본을 저에게 보내준 것이었습니다.

(이미지 출처: OpenClaw)
자동화할 수 있는 수많은 일들 중에서, 이것은 누군가가 OpenClaw를 어떻게 사용할 수 있는지 보여주는 가장 간단한 사례 중 하나일 것입니다. 단순하긴 하지만, 매일 RSS 피드를 쳐다보며 직접 기사를 찾는 시간을 조금이나마 아껴줄 것입니다. 하지만, 이는 올해 초 수많은 사람을 열광하게 만들었던 "말만 하면 당신이 원하는 무엇이든 해줄 것이다!"라는 약속과는 상당한 거리가 있습니다.
일반인에게 가치가 있을까요?
만약 당신이 OpenClaw에 대해 들은 것이 그저 무엇이든 할 수 있는 마법 같은 AI 에이전트라는 것이 전부라면, 제가 배운 바로는 그것은 완전히 사실이 아닙니다. 모델 선택을 이해하고, 어떤 모델이 도구 호출 (tool-calling)에 뛰어난 성능을 보이는지 파악하는 것과 같은 여러 요소에 능숙하지 않다면 말이죠. 소박한 로컬 설정을 실행하는 것은 재미있거나 만져보는 즐거움이 있을 수 있지만, 로컬 AI 개발자와 tinkerer(만지는 사람들)에게 진정한 힘은 명백한 곳에 있습니다. 즉, 더 크고 복잡한 모델을 실행할 수 있는 더 강력한 성능, 그리고 작업을 연속적으로 수행하는 더 많은 에이전트입니다. 실제로, 저희는 _Tom’s Hardware Premium_의 로컬 및 클라우드 AI 모델 혼합 활용 사례를 통해 이러한 워크플로 (workflows)가 실제로 어떻게 사용될 수 있는지 살펴보았습니다.
여기서 문제는 우리의 로컬 모델(local model)의 경우, 10개의 뉴스 기사를 실행하고 우리에게 보내는 이 간단한 작업조차 스스로 설정할 수 없었다는 점이며, 이는 이미 1,500달러가 넘는 하드웨어를 사용하고 있음에도 그러했습니다. 우리의 상주 로컬 AI 전문가이자 GPU 구루(guru)인 Jeff Kampman이 최근 테스트한 바와 같이, 클라우드에 전적으로 의존하지 않고 진정한 성능을 원하는 AI 진심인 분들이라면, 전용 GPU 가속 설정(GPU-accelerated setups)을 사용하거나 DGX Spark 또는 Dell Pro Max GB10 클러스터와 같은 전용 박스를 사용하여 더 강력하고 빠른 로컬 모델을 실행하기 위해 돈을 모아야 할 수도 있습니다. 이 두 가지 방식 모두 5,000달러 이상의 비용이 들 것입니다. 해당 하드웨어에서 실행 가능한 모델들이라면 비교적 단순한 크론 잡(Cron job) 설정조차 제대로 해내지 못하는 일은 없기를 바랄 뿐입니다.
진정한 질문은, 로컬 AI 추론(inference) 박스를 갖추는 것이 작업 방식이나 수행하는 업무를 유의미하게 변화시켜 그 비용을 회수할 수 있을 것인가 하는 점입니다. 많은 이들에게 이것은 스스로에게 던지는 지속적인 질문입니다. 현재 HammerClaw는 몇 시간마다 저에게 더 많은 기사를 보내주고 있으며, 이는 단순한 스크립팅(scripting)으로도 수행할 수 있는 작업입니다. 하지만 수동적인 "선별(sift)" 작업은 LLM(대규모 언어 모델)이 처리하고 있습니다. 멋진 일이긴 하지만, 저는 이 특권을 위해 1,500달러를 지불하지는 않을 것입니다. 다행히도, 이것은 단순히 AI 추론만을 위해 만들어진 박스가 아닙니다. 그곳에는 전체 컴퓨터가 연결되어 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Tom's Hardware의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기