1,000개 이상의 에이전트를 실행하는 6노드 12-GPU 온프레미스 (on-prem) AI 클러스터 구축기
요약
Azure OpenAI의 높은 비용, 지연 시간, 데이터 규제 문제를 해결하기 위해 6대의 머신과 12개의 GPU를 활용한 온프레미스 AI 클러스터를 구축한 사례입니다. 이 시스템은 1,000개 이상의 에이전트를 동시에 실행하며, 음성 응답 지연 시간을 300ms 미만으로 단축하고 클라우드 대비 빠른 손익분기점 도달을 가능하게 합니다.
핵심 포인트
- 클라우드 종속성(Lock-in) 및 지연 시간 문제를 해결하기 위해 3계층(GPU, CPU/RAM, 프로덕션) 구조의 온프레미스 클러스터 구축
- M1, M2 노드를 통한 고성능 추론 및 M1 장애 시 1.3초 내 페일오버가 가능한 고가용성 확보
- Whisper CUDA, MCP(Model Context Protocol), Docker Swarm 등을 활용한 다층적 소프트웨어 스택 구현
- Azure OpenAI 대비 50,000€ 규모 배포 시 7개월 만에 ROI 달성 가능
요약 (TL;DR) — 6대의 머신, 12개의 GPU, 1,000개 이상의 동시 실행 에이전트, P95 18ms, 음성 <300ms, 280,741줄의 Python 코드, 44개의 MIT 리포지토리 (repos). Azure OpenAI 대비: 50,000€ 규모 배포 시 7개월 만에 손익분기점 도달.
내가 이것을 구축한 이유
저는 Franck입니다. 프랑스 툴루즈에 거주하고 있습니다. 3년 동안 제대로 된 계산을 하기 전까지 Azure와 OpenAI에 약 280,000€를 지불했습니다. 그 이유는 다음과 같습니다:
지연 시간 (Latency): 음성 왕복(round-trip) 시간이 1.2초 — 제가 원하는 음성 우선 사용자 경험 (voice-first UX)과 호환되지 않음.
준수 사항 (Compliance): 고객 데이터가 미국 서버에 저장됨. GDPR 네이티브가 아니라, 서류상으로만 GDPR을 준수하는 수준.
할당량 (Quotas): 최악의 타이밍에 발생하는 무작위 스로틀링 (throttling).
종속성 (Lock-in): Azure 장애 발생 = 내 제품의 오프라인 상태.
저는 모든 것을 온프레미스 (on-prem)로 재구축하기로 결정했습니다. 이것이 그 결과물입니다.
클러스터
6대의 머신, 3개의 계층 (tiers), 총 12개의 GPU, 노드 간 지연 시간 (inter-node latency) <5ms.
계층 1 — GPU 연산 (heavy inference)
M1 "La Créatrice" — Ryzen 5700X3D, 6× RTX 3080+, 46 GB RAM. 주요 LLM 노드로, qwen3.5-9b, qwen3.5-35b-a3b, deepseek-r1, Claude 4.5/4.6 증류 모델 (distillations), 그리고 Whisper CUDA 파이프라인을 실행합니다.
M2 "Le Forge" — 멀티 GPU NVIDIA, 보조 추론 (secondary inference), M1 장애 시 1.3초 내에 페일오버 (failover) 수행.
계층 2 — CPU/RAM (오케스트레이션, 메모리)
M3 "Le Cerveau" — 고용량 RAM CPU 노드. PostgreSQL + Redis + Pinecone. 오케스트레이터 (orchestrator), 3-쿼럼 합의 엔진 (3-quorum consensus engine, M1+M2+M3), 그리고 분석/모니터링 에이전트를 실행합니다.
계층 3 — 프로덕션 / 작업
M4 "Bridge Windows" — Windows 11, 2개의 GPU, 트레이딩 봇 라이브 운영.
M5 "Interface Relay" — Linux i5-6500, 15 GB RAM. 개발 인터페이스, 15개 이상의 MCP 서버, Claude Code.
M6 "Mobile Ops" — 노트북. SSH + VPN. 클라이언트 데모 및 현장 운영용.
Ubuntu L9 위에 추가한 9개의 레이어:
L9 — 음성 / 대화형 (Whisper CUDA STT, Piper TTS, 웨이크 워드 (wake word), 50개 이상의 언어)
L8 — 멀티 에이전트 오케스트레이션 (Multi-agent orchestration) (MCP 네이티브, 합의 엔진 (consensus engine))
L7 — 트레이딩 합의 엔진 (Trading consensus engine) (멀티 모델 투표 GPT/Gemini/Claude)
L6 — 브라우저 + 웹 자동화 (Browser + web automation) (Chrome DevTools Protocol)
L5 — MCP 도구 레지스트리 (MCP tool registry) (88개 이상의 핸들러 (handlers))
L4 — GPU 클러스터 관리 (GPU cluster management) (Docker Swarm, 2초 미만의 페일오버 (failover))
L3 — Domino 파이프라인 엔진 (Domino pipeline engine) (835개 체인)
L2 — systemd 서비스 레이어 (systemd service layer) (98개 유닛)
L1 — Linux 부팅 통합 (Linux boot integration) (GRUB 훅 (hooks), ZRAM, 커널 파라미터 (kernel params))
실제 수치
지표 | 값
동시 실행 에이전트 (Concurrent agents) | 1,000+
P95 지연 시간 (클러스터 내부) (P95 latency (cluster internal)) | 18 ms
음성 파이프라인 엔드 투 엔드 (Voice pipeline end-to-end) | <300 ms
총 처리량 (Aggregate throughput) | 67 tok/s
Python 코드 라인 수 | 280,741
공개 리포지토리 (Public repos) | 44개 (모두 MIT 라이선스)
비용 비교 (일일 100만 토큰, 10명 규모 팀 기준)
제공업체 | 월별 비용 (€/month) | P95 지연 시간 | 동시 실행 에이전트 | 데이터 거주성 (Data residency)
Azure OpenAI | 1,500 | 800ms-3s | ~20 | US
AWS Bedrock | 1,800 | 700ms-2.5s | ~15 | US
Mistral Cloud | 800 | 400-800ms | ~30 | EU
JARVIS OS | 0 | 18 ms | 1,000+ | 에어갭 (Air-gapped)
50,000€ 규모의 턴키 (turn-key) 구축 시, Azure 대비 손익분기점은 7개월이며, 그 이후의 한계 비용 (marginal cost)은 0입니다.
현재 판매 중인 항목
JARVIS OS 턴키 — 범위에 따라 20,000€에서 250,000€.
62개의 PDF 교육 자료 — 39€부터 시작, 프로덕션 코드 기반의 293시간 분량 콘텐츠 (+48개 비공개).
AI 인프라 감사 (IA infra audit) — 1,500€, 48시간 이내 보고서 제공.
1:1 멘토링 — 시간당 250€.
Fractional CTO — TJM(일당) 1,000-1,150€ / CDI(연봉) 85-95K€.
Toulouse / 원격 근무.
솔직한 약점
합의 투표 (Consensus voting)는 경험적입니다. 합의 함수 (agreement function)에 대한 공식 검증 (formal verification)이 없습니다.
Tier-2 장애 (M3 다운)는 가장 취약한 시나리오입니다. 오케스트레이터 (orchestrator)가 중단되면 클러스터는 추론을 계속하지만 영구 메모리 (persistent memory)를 상실합니다.
MCP 프로토콜에 대한 베팅 — 만약 Anthropic이 MCP의 일부를 폐기한다면, 리팩토링해야 할 88개의 핸들러가 있습니다.
토큰당 kWh 효율 — 총 와트/토큰 (watts/token) 측면에서는 클라우드가 승리할 가능성이 높지만, 한계 비용 측면에서는 온프레미스 (on-prem)가 승리합니다.
사이트 링크: https://jarvis-delmas.netlify.app 코드: https://github.com/Turbo31150 (44개의 MIT 리포지토리) 연락처: [email protected]
만약 여러분도 집에서든 고객을 위해서든 이와 유사한 환경을 운영하고 계신다면, 서로의 경험을 공유하고 싶습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기