3090에서 20 DGX로 업그레이드: 우리 집 차단기가 첫 번째 병목이었습니다
요약
사용자는 LLaMA부터 DeepSeek, Kimi K3 등 거대 오픈 웨이트 모델을 로컬에서 구동하며 성능 향상을 경험했습니다. 초기 3090 사용 후 전력 및 병목 현상에 직면했으나, ASUS GB10 같은 고성능 GPU 클러스터를 구축하여 속도와 안정성을 극적으로 개선했습니다. 최종적으로 여러 개의 노드를 연결한 대규모 클러스터 환경을 완성하고 최신 모델들을 구동하는 과정을 공유합니다.
핵심 포인트
- 거대 LLM 로컬 구동 시 전력 및 전기 인프라가 주요 병목 지점입니다.
- ASUS GB10 같은 고밀도 GPU 클러스터는 성능과 안정성 면에서 혁신적입니다.
- 클러스터 구축을 통해 대규모 모델의 추론 속도를 획기적으로 향상시킬 수 있습니다.
- 최종적으로 여러 노드를 조합하여 다양한 크기의 모델들을 동시에 구동하는 환경을 완성했습니다.
처음 LLaMA 33B를 접했을 때부터, 저는 그 마법 같은 지능을 로컬에서, 저만의 것으로 갖고 싶다는 생각이 들었습니다. 필요할 때 아무도 빼앗아 갈 수 없는 것이요. 그래서 집 PC용으로 3090을 구매했습니다. 그러다가 LLaMA 65B가 등장했고, 저는 완전히 매료되었습니다. 마치 세상의 모든 지식을 가진 것처럼 보였습니다. 저는 두 개의 사본을 만들었습니다. 하나는 로컬에 두고 다른 하나는 Synology NAS RAID에 저장하여 절대 잃어버리지 않도록 했고, 또 하나의 3090을 구매해 이를 구동했습니다. LLaMA와 Qwen 모델로 작은 코딩 작업을 하면서 일 년 동안 만족스럽게 지냈습니다.
그러다 DeepSeek 671B MoE가 등장했습니다. 와우, 집에서 접하는 프론티어 수준이었습니다. 저는 Threadripper를 512GB DDR4와 함께 업그레이드했고, 전문가(experts)를 RAM으로 오프로드하여 8 t/s로 구동하거나, 속도가 필요할 때는 Qwen 235B를 10~12 t/s로 구동했습니다. 저는 이 모델들을 OpenWebUI에서 실제 업무 코딩에 사용했습니다.
그러자 에이전트 기반 코딩(agentic coding)이 대세가 되면서, 기존 시스템으로는 너무 느렸습니다. 컨텍스트 길이 10만 토큰 생성 속도가 절반으로 줄어들었고, 프리필(prefill) 과정은 아름다우면서도 고통스러운 경험이었습니다. 그래서 저는 100Gbit 네트워크의 P620 기반 노드에 걸쳐 16x3090을 구축했습니다. MiniMax M2와 Qwen 235B, 심지어 Qwen 397B까지, 누구나 바랄 만한 만큼 잘 구동되었습니다. 저는 OpenCode에서 397B를 이용해 전체 유료 프로젝트를 만들었습니다. 하지만 더 큰 모델들은 손이 닿지 않았고, 집의 전력 회로가 거절했습니다. 장비와 전기 오븐을 함께 사용하면 차단기가 끊어지는 것이었죠. 열과 안정성도 문제가었습니다.
다음으로 ASUS GB10 4개를 가져왔습니다. 이 모델들이 연결될 수 있다는 것을 읽은 후였습니다 (지원되는 최대 구성은 3개였습니다). 400W에서 397B를 30 t/s로 구동하는 것과, 6kW에서 50~60 t/s로 구동하는 것은 비교할 수 없었습니다. 견고하고 거의 소음이 없었죠. 꿈이 현실이 된 기분이었습니다. 저는 이것으로 두 개의 프로젝트를 더 만들었습니다. 그리고 MiMo 2.5 Pro와 Kimi 2.6이 등장했고, 이들은 더 똑똑하고 생산적이었습니다. 저는 8노드 클러스터에 대한 공개된 솔루션을 찾지 못했지만, 그래도 GB10을 네 개 더 구매해서 작동하게 만들었습니다. 397B를 INT4 대신 FP8로 구동하여 20% 더 빠르게 했습니다. NVIDIA 포럼의 8xSparks에 최초의 MiMo 2.5 Pro 및 Kimi 2.6 솔루션을 게시했습니다. 결과가 너무 마음에 들어서, 저는 언니/오빠에게 제 GB10 8개 세트를 사도록 설득했고, 그도 API 가용성과 상승하는 비용에 의존하지 않고 개인 정보 보호를 유지하며 최고의 오픈 모델들을 로컬에서 구동할 수 있게 했습니다.
그의 집은 제 집에서 걸어서 5분 거리입니다. Kimi K3 (2.8T)가 등장했을 때, 가장 크고 스마트한 오픈 웨이트 모델이었습니다. 저희는 클러스터에 합류했습니다: 일상 사용을 위한 두 개의 8x 클러스터 또는 집에서 가장 큰 모델을 원할 때 하나의 16x를 사용합니다. 몇 가지 작업을 거쳐 NVIDIA 포럼에 Kimi K3의 첫 작동 솔루션을 16x Sparks로 게시했습니다. 여러 번 반복한 끝에, 이 속도는 10만 컨텍스트에서 사용할 수 없는 7 t/s에서 상당히 사용 가능한 30만 컨텍스트에서의 20 t/s까지 향상되었습니다.
지금은 Sparks 4개를 더 추가하여, 작고 빠른 모델(GLM 5.3 Flash)이 24시간 내내 작동하고, 큰 클러스터는 다른 8x에서 GLM 5.3 또는 MiMo 2.6 Pro를 사용하거나, 16x Kimi K3, 또는 Qwen 3.8 2.4T 중 하나가 실행되도록 합니다.
저는 항상 대규모 모델의 속도를 조정하고 vLLM/SGLang 이미지를 재구축하기 때문에, 상시 작동하는 작은 클러스터가 합리적입니다. 왜냐하면 저의 모든 작업 프로젝트와 vllm/sglang 개인 프로젝트를 위해 저는 로컬 호스팅된 모델만 사용하기로 선택했기 때문입니다. 저는 비용 때문이 아니라, 로컬 모델의 미래에 대한 강한 확신 때문에 상업용 모델 구독료를 지불한 적이 없습니다. 그 모델들은 10월 2일에 도착하며, 같은 로컬 AI 미생물에 감염된 제 남동생을 위해 Sparks 4개도 함께 받게 됩니다 :)
제출자 /u/ciprianveg [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기