【완전 무료】 VS Code・CLI・Obsidian을 연결하는 AI 에이전트 병렬 작업 환경과 무료 LLM의 실제 사용 후기
요약
본 글은 API 토큰 비용과 사용 제한 문제를 해결하기 위해, 무료 LLM 프로바이더와 IDE 확장 기능의 회복형 할당량을 결합한 병렬 개발 환경 구축 방법을 소개합니다. Nemotron-3-Ultra, Gemini 3.8 Flash 등 다양한 무료 모델들의 실제 사용감과 멀티 에이전트 운영 노하우를 공유하며 비용 제로 개발 환경을 제시합니다.
핵심 포인트
- 비용 부담 완화를 위해 무료 LLM 및 회복형 할당량을 조합하는 것이 핵심입니다.
- Nemotron-3-Ultra는 트러블슈팅, 자율 추론 등에서 매우 실용적이고 믿음직한 성능을 보여줍니다.
- Gemini 3.8 Flash는 일상적인 코드 상담이나 자연스러운 대화에 강점을 보였습니다.
- Obsidian 연동 및 CLI 환경 구축으로 비용 제로의 지속 가능한 개발 워크플로우를 완성했습니다.
서론
코딩이나 문서 정리, 트러블슈팅에 AI 에이전트를 전면적으로 활용하는 일상이 당연해졌다. 하지만 여기서 항상 골치 아픈 것이 종량제 API의 토큰 비용과 **도구 사용 제한(Rate Limit)**이다.
Cursor나 Claude Code, Cline 같은 자율형 에이전트에게 큰 작업을 맡기면 순식간에 수만~수십만 토큰이 사라진다. 개인 개발로 매일 이것을 돌리는 것은 비용적으로 부담스럽다.
그래서 나는 **'무상으로 이용 가능한 LLM 프로바이더', 'IDE 확장 기능의 회복형 무료 할당량', 'AI 특화 터미널 멀티플렉서', 'Obsidian 연동'**을 결합하여, 비용 제로로 끊임없이 작업할 수 있는 병렬 개발 환경을 구축하고 운영하고 있다.
본 기사에서는 현재 주력으로 사용하는 무료 LLM(Nemotron-3-Ultra, LongCat, Gemini 3.8 Flash, Muse Spark 1.3 등)의 실제 사용감과, Herdr / Claudian을 활용한 멀티 에이전트 환경의 전모, 그리고 자율 에이전트 운영에서 부딪힌 '무료 할당량만의 벽'과 대책을 정리한다.
전체 스택 개요
구축하고 있는 환경의 전체 모습은 다음과 같다.
┌─────────────────────────────────────────────────────────────┐
│ 작업 인터페이스 │
├───────────────────┬───────────────────┬─────────────────────┤
...
1. 주로 사용하는 무료 모델과 실제 사용감
무료로 사용할 수 있는 모델들을 몇 가지 순환하며 테스트하고 있지만, 결론적으로 NVIDIA의 Nemotron-3-Ultra가 단연코 실용적이다.
| 모델명 | 주요 이용 프로바이더 | 강점 분야・실제 사용감 |
|---|---|---|
| Nemotron-3-Ultra | Ollama Cloud / OpenRouter | Vault 조작, 트러블슈팅, 자율 추론. 매우 믿음직함 |
| LongCat | Nous Portal | 장문맥 처리. Nemotron과 비교하면 추론력은 다소 떨어진 인상 |
| Gemini 3.8 Flash | VS Code (Antigravity) | 일본어 대화가 매우 자연스럽고 빠름. 일상적인 설계・코드 상담의 메인 |
| GPT-5.6-Luna | Obsidian (Claudian 경유) | Codex CLI를 자동 감지시켜 노트 조작・문서 집필에 활용 |
| Muse Spark 1.3 | OpenCode | 무료 할당량으로 이용 가능(기여자 할당량). 나쁘지 않음 |
| Space bunny | 각종 | 이름은 귀엽지만, 실용 면에서는 솔직히 별로 쓸 수 없는 인상 |
Nemotron-3-Ultra의 실력
Nemotron-3-Ultra는 오픈 웨이트임에도 총 파라미터 550B(활성 약 55B)를 가진 MoE 아키텍처의 초대형 모델이다.
실제로 마주친 'Hermes Agent 업데이트 실패 에러' 상황에서, 에러 로그 전체를 넘겨 원인 규명을 맡겼더니, 의존 관계가 손상된 부분을 정확히 특정하고 복구 절차를 제시하여 해결에 이르게 했다. Obsidian의 Markdown 정리나 파일 조작 정도라면 거의 스트레스 없이 맡길 수 있다.
OpenCode에서의 Muse Spark 1.3
OpenCode 위에서 코딩할 때는 기여자(Contributor)를 위해 무상 제공되는 Muse Spark 1.3을 사용하고 있다(학습 데이터로 사용될 가능성이 있다는 점은 유의). 이전에 이 모델을 사용해 팟캐스트 제작에 도전한 기록을 Zenn에 썼는데, 일상적인 스크립트 작성이라면 충분히 실용적인 수준으로 작동해 준다.
2. VS Code 확장 기능의 '회복형 무료 할당량' 순환술
VS Code에서 작업할 때, 유료 플랜을 계약하지 않아도 **'시간 경과나 일별・월별로 조금씩 회복되는 무료 할당량'**을 가진 툴들을 조합하는 것이 극도로 편리하다.
Antigravity (:agy
)
-
Google 개발의 자율 코딩 확장.
-
**Gemini 3.8 Flash (Medium)**가 선택 가능하며, 일본어 대화의 자연스러움과 응답 속도 밸런스가 단연 돋보인다.
-
GitHub Copilot: 일상적인 인라인 자동 완성이나 간단한 채팅에 사용.
-
Codex: 특정 코드 생성이나 파일 편집의 정밀 실행.
'Auto' 모델 선택의 편리함
Kiro CLI나 Cursor CLI, Copilot 등은 모델 선택을 'Auto'로 설정해 두는 것이 가장 편하다.
간단한 함수 리팩토링이나 테스트 코드 작성 정도라면, 백그라운드에서 가볍고 최적화된 모델이 자동으로 선정되기 때문에 '어떤 모델을 사용해야 할까'에 대한 사고 자원을 낭비하지 않는다.
'전체적인 설계나 무거운 상담은 Antigravity (Gemini 3.8 Flash)' → '작성 중인 인라인 자동 완성은 Copilot' → '별 모듈 수정은 Cursor CLI (Auto)'와 같이 분산 배치함으로써, 하나의 도구가 가진 제약에 걸리지 않고 작업을 지속할 수 있다.
3. Omarchy × Herdr를 통한 병렬 에이전트 환경
Arch Linux 기반 환경(Omarchy)에서는 AI 에이전트에 특화된 터미널 멀티플렉서 Herdr를 도입했다.
기존의 tmux나 zellij와 달리, Herdr는 '페인 내에서 동작하는 AI 에이전트의 상태'를 자동으로 감지한다 (Agent-Native Multiplexing).
working: 사고/처리 중 -blocked: 사용자 승인이나 입력 대기 -done: 작업 완료 -idle: 대기 중
사이드바(Attention Queue)만 보면, '어떤 페인의 에이전트가 자신의 입력을 기다리는지' 즉시 알 수 있기 때문에, 화면을 일일이 전환하며 상태를 확인할 필요가 없다.
현재 Herdr에서 상시 구동하는 '최강의 무료 세트'는 다음과 같다:
- OpenCode (
opencode) - - Kiro CLI (
kiro) - - Copilot (
gh copilot) - - Codex (
codex) - - Antigravity (
agy) - - Hermes Agent (
hermes) - - Cursor CLI (
agent)
하나의 에이전트가 무거운 조사나 테스트를 실행하는 동안, 다른 에이전트에게 스크립트를 작성하도록 시키는 '대기 시간 제로' 작업 흐름을 구현할 수 있다.
4. Obsidian 연동: Claudian과 로컬 에이전트
d큐멘트 작성이나 지식 관리(제2의 뇌)에는 Obsidian을 사용하고 있는데, 여기에 AI 에이전트를 직접 연결할 수 있는 Claudian 플러그인 (v2.3.16 / Yishen Tu 제작)이 매우 뛰어나다.
CLI 자동 감지가 편리하다
Claudian은 로컬 PC에 설치된 다양한 CLI를 자동으로 감지(Auto Detect) 해준다.
현재 지원하는 프로바이더:
- Claude Code
- Codex CLI (자동 감지로 GPT-5.6-Luna와 연동 중)
- Grok Build
- OpenCode
- Pi
수동으로 API 키나 실행 경로를 입력할 필요 없이, 토글을 ON으로 하는 것만으로 Obsidian Vault를 작업 디렉토리(Workspace)로 인식시킬 수 있다.
미니멀 에이전트 'Pi'의 주목할 만한 점
지원 프로바이더 중 Pi (Pi Coding Agent / Mario Zechner 제작)가 있어 흥미롭게 사양을 조사해 보았다.
Pi는 기능을 read, write, edit, bash 네 가지 기본 도구로만 제한한 극도로 미니멀한 설계이다. 불필요한 오버헤드가 없기 때문에, Vault 내의 Markdown 조작이나 경량 작업과 궁합이 매우 좋아 보여 현재 검증을 진행하고 있다.
OpenCode와 WSL 주의사항
なお、OpenCodeをWSL(Windows Subsystem for Linux)上にインストールしている場合、Windows版ObsidianのClaudianからは自動検出されない。OpenCode公式はLinux/WSLでの利用を推奨している(シェルコマンドやパーミッションの安定性のため)。AIエージェント全般がLinux環境と高い親和性を持っていることの現れだが、Obsidianと直結させる場合はWindowsネイティブ側のインストール状況に注意が必要だ。
5. 부딪힌 벽: 자율 에이전트 × 무료 사용량 제한의 함정
이 '무료 세트'를 운영하는 과정에서 가장 큰 좌절감을 느낀 것은 'VS Code의 Cline에 OpenRouter의 무료 사용량(Nemotron-3-Ultra 등)을 연결했을 때' 였다.
1. 순식간에 토큰이 소진되는 문제
일반적인 채팅이라면 수천 토큰으로 충분하지만, Cline과 같은 자율 에이전트는 내부적으로 매 턴 다음과 같은 처리를 반복한다:
- 거대한 시스템 프롬프트와 도구 정의 (JSON 스키마가 매 턴 전송됨) 프로젝트 트리 및 관련 파일 전체 로딩-
- 자율 루프에 의한 대화 기록의 눈덩이식 누적 (10~20턴 만에 수십만 토큰으로 급증)
추론력이나 컨텍스트 파악 능력이 최고 수준(Claude 3.5 Sonnet 등)이 아닌 모델에게 자율 탐색을 맡기면, 의도를 파악하지 못하고 불필요한 파일을 여러 번 로딩하며 헤매다가 순식간에 토큰을 소모해 버린다.
2. '탈 만하면 멈추는' 속도 제한(Rate Limit)
OpenRouter의 :free 엔드포인트는 공유 사용량이기 때문에, 일일/분별 상한이 엄격하다.
'좋아, 순조롭게 코드가 작성되기 시작했다!'라는 흐름을 탄 바로 그 순간에 속도 제한에 도달하여 작업이 강제 중단된다.
대처법
- 작업의 단위를 극도로 작게 쪼개기: '이 기능을 만들어줘'가 아니라 '함수 A의 타입 에러만 고쳐줘'와 같이 1~2단계로 끝나는 지시를 내린다. - 로드할 파일을 제한하기: 디렉토리 전체 자동 탐색을 시키지 않고, 대상 경로를 정확히 지정하여 전달한다. - 무거운 자율 실행을 무료 API에 의존하지 않기: 일상적인 코드 생성은 Antigravity나 Copilot 같은 복구형 IDE 확장 기능에 맡긴다.
맺음말
API 종량제(従量課金)를 신경 쓰지 않고, 쾌적하게 코딩이나 지식 정리를 할 수 있는 '무료 에이전트 작업 환경'을 정리해 보았다.
- 무료 제공자: Ollama Cloud (Nemotron-3-Ultra) 또는 OpenRouter 활용 - IDE 환경: Antigravity (Gemini 3.8 Flash)나 Copilot의 복구형 무료 사용량 로테이션 - 터미널: Omarchy + Herdr를 통한 병렬 에이전트 모니터링 - 노트 환경: Obsidian + Claudian을 통한 볼트(Vault) 내 자동 편집
하나의 도구에 의존하면 금방 벽에 부딪히지만, 각각의 특성을 이해하고 파이프라인을 구성하면 완전 무료임에도 놀라울 정도로 쾌적한 개발 경험을 얻을 수 있다.
각 도구의 도입 절차나 설정, 새로운 모델 검증 로그는 개인 디지털 가든(Digital Garden)에서도 수시로 업데이트하고 있으니, 관심 있는 분들은 꼭 들러봐 주었으면 한다.
Discussion

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기