
Dell의 Pro Max GB10를 활용한 로컬 AI 클러스터링 — 두 개의 Nvidia Grace Blackwell를 연결하여 가정에서 AI
요약
Dell의 Pro Max GB10 시스템 두 대를 연결하여 256GB의 대규모 로컬 VRAM을 확보하는 AI 클러스터 구축 방법을 소개합니다. 고가의 단일 워크스테이션 대신 네트워크 스케일 아웃 방식을 통해 대규모 언어 모델(LLM)을 효율적으로 구동하는 대안을 제시합니다.
핵심 포인트
- Nvidia GB10 시스템을 활용한 로컬 AI 클러스터링 구현
- 네트워크 스케일 아웃을 통한 256GB 통합 메모리 확보
- 고가의 단일 GPU 서버 대비 비용 및 전력 효율적 대안 탐색
- ConnectX 7 200Gbps NIC 및 RoCE 지원을 통한 분산 컴퓨팅
2026년의 로컬 AI 테스트는 Nvidia GB10 및 AMD Strix Halo 시스템의 128GB 통합 메모리(unified memory)에 완전히 들어갈 수 있는 대규모 언어 모델(LLM)에 집중해 왔습니다. 이러한 소규모 오픈 모델들이 유용하기는 하지만, 때로는 물리적인 확충을 대체할 수 없는 경우가 있습니다. 오늘 우리는 두 개의 Nvidia GB10 시스템, 즉 Dell의 Pro Max GB10 (이하 Pro Max)을 사용하여 로컬 AI 샌드박스를 위한 256GB의 RAM을 확보함으로써 로컬 AI 클러스터로 무엇이 가능한지 탐구해 보고자 합니다.
AI 모델을 고정밀(higher-precision)에서 저정밀(lower-precision) 데이터 타입으로 양자화(Quantizing)하는 것은 성능과 정확도 사이의 트레이드오프(tradeoffs)를 수반합니다. 그리고 양자화된 형태라 할지라도 일부 고급 오픈 모델들은 여전히 128GB 내에 담기에는 너무 큽니다. 하지만 데이터 센터에서와 마찬가지로, 네트워크를 스케일 아웃(scale-out) 백본으로 사용하여 이러한 모델들을 여러 로컬 시스템에 분산시킬 수 있습니다.
왜 GB10 시스템(또는 Strix Halo, 또는 Mac)을 스케일 아웃해야 할까요? 개별 GPU들로 구축된 대규모 VRAM 풀을 갖춘 로컬 토큰 팩토리(token factories)는 엄청나게 빠른 속도를 낼 수 있습니다. 하나의 시스템을 128GB의 VRAM까지 확장하려면 해당 카드들에 데이터를 공급할 수 있는 충분한 PCI Express 슬롯과 대역폭(bandwidth)을 갖춘 고가의 호스트 시스템이 필요하며, 128GB를 초과하려면 기존의 48GB Ada 카드부터 구축하더라도 최소 2만 달러 이상의 Nvidia GPU 비용이 발생합니다.
이러한 종류의 설정을 위한 선호되는 레시피는 일반적으로 Threadripper Pro 또는 Epyc 플랫폼을 포함하며, 이는 그래픽 카드를 추가하기 전부터 이미 고가의 CPU, 메인보드 및 DDR5 키트가 필요함을 의미합니다. 이러한 시스템의 전력 요구 사항은 미국의 표준 15A 회로(최대 1,800W)의 용량을 빠르게 초과할 수 있습니다.
또한, 본질적으로 GPU 서버나 다름없는 장치에서 네 개의 개별 GPU가 부하 상황에서 블로워 팬(blower fans)을 고속으로 돌리고, 여기에 필요한 다른 능동 냉각(active cooling) 장치들까지 더해진다면, 같은 공간을 공유하는 사용자에게 결코 쾌적한 환경을 제공하지는 못할 것입니다.
4개의 RTX Pro 5000 또는 RTX Pro 6000 카드를 탑재한 GPU 서버가 특정 애플리케이션에서 절대적인 최고의 성능을 끌어내는 데 유용할 수는 있지만, 잠재적으로 높은 비용, 플랫폼의 한계, 그리고 삶의 질(quality of life)에 대한 우려로 인해 로컬 AI 애호가들은 오늘 우리가 구축하고 있는 GB10 클러스터와 같이, 수용 가능한 수준의 LLM 추론 성능을 유지하면서 대규모 로컬 메모리 풀을 확보할 수 있는 다른 방법들을 탐색해 왔습니다.

(Image credit: Tom's Hardware)
Nvidia는 내장된 ConnectX 7 200Gbps NIC(네트워크 인터페이스 카드) 덕분에 DGX Spark와 그 유사 시스템들을 즉시 확장 및 클러스터링이 가능한 시스템으로 만들었습니다. 이러한 하이엔드 인터페이스는 RoCE(Remote Direct Memory Access over Converged Ethernet)를 지원하므로, 두 개(또는 그 이상)의 GB10 박스를 분산 AI 컴퓨팅 클러스터의 백본(backbone)으로 사용할 수 있습니다.
초기 리뷰 당시에는 RDMA 클러스터링을 테스트할 수 있는 여러 대의 Spark가 없었지만, Dell은 두 시스템을 연결하는 데 필요한 QSFP 케이블과 함께 한 쌍의 Pro Max GB10 시스템을 보내주었습니다.
이 시스템들이 여전히 저렴한 편은 아니지만, 4TB SSD가 포함된 테스트 구성 기준으로 이 글을 쓰는 시점에 각각 6,332달러라면, 유사한 GPU 서버 빌드를 확장하는 데 필요한 48GB 또는 72GB GPU 4개의 비용보다 적은 금액으로 256GB RAM을 갖춘 완전한 턴키(turn-key) 클러스터를 구축할 수 있습니다.
만약 비용을 절감해야 하고 그 대가로 절대적인 성능을 타협할 수 있다면, 현재 대규모 로컬 모델을 다루기 위한 이보다 더 저렴한 방법은 없다고 단언할 수 있습니다. 특히 DGX Spark 플랫폼이 제공하는 수준의 네트워킹 성능을 고려한다면 더욱 그렇습니다.

(Image credit: Tom's Hardware)
Dell의 GB10 탑재 Pro Max는 Spark의 템플릿을 밀접하게 따르고 있지만, DGX Spark에는 없는 매우 유용한 전원 LED를 전면 패널에 추가했으며, 전면 및 후면 패널의 육각형 그릴은 DGX Spark의 금속 폼(metal foam) 전후면 패널처럼 옷이나 극세사 천에 걸리지 않습니다.

(Image credit: Tom's Hardware)
Dell은 또한 각 Pro Max GB10 시스템에 280W 대용량 USB-C 전원 어댑터를 제공하며, 이는 레퍼런스(reference) DGX Spark에 포함된 어댑터보다 40W 더 높은 용량입니다. 하지만 이로 인해 해당 시스템의 TDP(열 설계 전력)나 클럭(clocks)이 더 높아진다는 암시는 없습니다.
<table><caption>GB10을 탑재한 Dell Pro Max</caption><tbody><tr><td class="firstcol "><p><strong>CPU</strong></p></td><td><p>Nvidia GB10</p><p>10x Arm Cortex-X925<br>10x Arm Cortex-A725</p></td></tr><tr><td class="firstcol "><p><strong>GPU</strong></p></td><td><p>Nvidia Blackwell GPU, 6144 CUDA 코어</p></td></tr><tr><td class="firstcol "><p><strong>메모리 (Memory)</strong></p></td><td><p>128GB LPDDR5X</p></td></tr><tr><td class="firstcol "><p><strong>스토리지 (Storage)</strong></p></td><td><p>4TB PCIe Gen 4 NVMe SSD</p></td></tr><tr><td class="firstcol "><p><strong>주변 장치 및 디스플레이 연결성 (Peripheral and display connectivity)</strong></p></td><td><p>DisplayPort Alt Mode를 지원하는 3x USB 3.2 Gen2x2 Type-C 포트</p><p>1x HDMI 2.1b 포트</p><p>Bluetooth 5.4</p></td></tr><tr><td class="firstcol "><p><strong>네트워킹 (Networking)</strong></p></td><td><p>Nvidia ConnectX 7 Smart NIC, 200Gbps (QSFP)</p><p>10Gb Ethernet (RJ45)</p><p>Wi-Fi 7</p></td></tr><tr><td class="firstcol "><p><strong>운영 체제 (Operating system)</strong></p></td><td><p>Nvidia DGX OS (Linux)</p></td></tr><tr><td class="firstcol "><p><strong>전원 어댑터 (Power adapter)</strong></p></td><td><p>280W USB Type-C</p></td></tr><tr><td class="firstcol "><p><strong>크기 (Dimensions)</strong></p></td><td><p>5.9” x 5.9” x 2” (HWD) (150mm x 150mm x 51mm)</p></td></tr></tbody></table>Dell은 출시된 DGX Spark의 Gen 5 드라이브와 비교하여 Pro Max GB10의 스토리지 사양을 PCIe Gen 4 SSD로 낮추었지만, 지속되는 NANDpocalypse(낸드포칼립스)로 인해 Nvidia가 비용 절감을 위해 레퍼런스 시스템용으로 Gen 4 드라이브를 조달할 수밖에 없었던 것으로 보입니다. 따라서 저희는 이 결정을 Dell의 결함으로 간주하지 않습니다.
설정하기 (Setting up)
저희는 이미 별도의 리뷰를 통해 DGX Spark 레퍼런스 디자인(DGX Spark reference design)을 다룬 바 있으므로, 만약 이 플랫폼의 기초에 익숙하지 않으시다면 해당 기사를 먼저 읽어보실 것을 권장합니다. 오늘 저희는 이 시스템 두 개를 함께 클러스터링(clustering)할 때 발생하는 구체적인 과제와 장애물에 초점을 맞추겠습니다.
이 시스템에 탑재된 ConnectX 7 NIC는 애드인 카드(add-in card) 형태에서 Infiniband와 Ethernet 프로토콜을 모두 지원하지만, Nvidia는 공식 DGX Spark 포럼을 통해 GB10 시스템은 Ethernet만을 독점적으로 지원하며, 따라서 클러스터링을 위해 RoCE (RDMA over Converged Ethernet)를 사용한다고 밝힌 바 있습니다. 집에 굴러다니는 Infiniband 스위치를 통해 이 시스템들을 연결할 수 있을 것이라 기대하며 여러 대를 구매하지 마십시오.
Spark 및 Dell Pro Max와 같은 유사한 Spark 시스템의 ConnectX 7 NIC는 플랫폼의 잠재적인 제한 사항으로 인해 GB10 SoC와 다소 기묘한 방식으로 연결되어 있습니다. 요약하자면, GB10에서 얻을 수 있는 최대 PCIe 버스 폭(bus width)은 PCIe 5.0 x4 링크인 것으로 보이므로, 단일 QSFP 포트에서 200Gbps를 달성하기 위해서는 ConnectX 7로 향하는 두 개의 x4 링크가 하나의 물리적 포트 뒤에서 팀(teamed)으로 묶여야 합니다. 그 결과, NIC의 각 물리적 포트는 시스템에 두 개의 논리적 인터페이스(logical interfaces)로 나타납니다.

(이미지 출처: Tom's Hardware)
ConnectX 7에서 사용 가능한 전체 200Gbps 대역폭을 확보하려면 네트워크 토폴로지(networking topology)를 신중하게 구성해야 합니다. Nvidia는 이를 수행하는 방법에 대한 Spark 플레이북(playbook)을 제공하고 있으며, spark-vllm-docker 프로젝트 또한 이러한 인터페이스를 설정하는 방법에 대한 자체 가이드를 제공합니다. 직접 구성을 시도해야 할 타당한 이유가 없다면, 이 가이드들을 엄격히 따를 것을 권장합니다.
후면 패널의 동일한 QSFP 케이지를 사용하여 Dell Pro Max 박스들을 서로 연결하고, 위의 spark-vllm-docker 가이드에 따라 네트워크 인터페이스를 구성하며, 두 번째 노드에 비밀번호 없는 SSH (passwordless SSH)를 설정하고, 링크에 대해 권장되는 NCCL 대역폭 테스트를 실행한 결과, 두 박스 모두 DGX Dashboard 앱을 통해 최신 상태임을 보고했음에도 불구하고 예상되는 RDMA 대역폭의 아주 작은 일부만을 얻을 수 있다는 사실을 발견했습니다.
커뮤니티의 지식에 따르면 펌웨어 버전 불일치가 원인일 가능성이 높다고 하여, 저는 클러스터의 헤드 Pro Max 노드가 DGX Dashboard 앱과 apt 패키지 관리자를 사용한 명령줄(command line) 모두에서 완전히 최신 상태인지 확인했습니다.
하지만 DGX Dashboard는 두 번째 Pro Max 시스템이 완전히 최신 상태라고 보고했음에도 불구하고, 권장되는 명령줄 apt 체크를 실행한 결과 fwupd 패키지에 대한 업데이트가 단계적 배포(phasing fence)에 걸려 멈춰 있는 것을 확인했고, 이에 강제 설치(force-install)를 진행했습니다.
이 강제 업데이트가 완료되자 두 번째 Pro Max를 위한 새로운 라운드의 펌웨어 업데이트가 해제되었고, 저는 이를 성실히 적용했습니다. 두 시스템을 재부팅하고 권장되는 NCCL 대역폭 테스트를 다시 실행한 결과, 마침내 적절한 200Gbps 링크에서 기대할 수 있는 수치인 25GB/s에 근접하는 성능을 얻을 수 있었습니다.
Pro Max GB10 시스템을 클러스터링하는 과정에서 겪은 문제들이 진행을 완전히 막을 정도는 아니었지만, 그렇다고 해서 플러그 앤 플레이 (plug-and-play) 경험과는 거리가 멀었습니다. 하지만 두 시스템이 모두 안정화된 후에는, 클러스터를 여러 번 재부팅하더라도 ConnectX 7 포트를 통한 대역폭이 처음에 관찰되었던 저하된 성능 수준으로 다시 떨어지는 일은 없었습니다.
클러스터 관리 및 성능 (Cluster management and performance)
만약 Sparks 클러스터링을 고려하고 있다면, 텐서 병렬성 (Tensor Parallelism), 즉 연산 중에 GPU 전반에 걸쳐 모델 가중치를 분산시키는 작업을 처리할 수 있는 추론 엔진 (Inference Engine)이 필요합니다. spark-vllm-docker 및 sparkrun과 같이 활발하게 유지 관리되는 커뮤니티 도구 덕분에 DGX Spark 플랫폼에서 이를 수행하기 위한 쉬운 선택지는 vLLM입니다. 하지만 선호하는 플랫폼이 SGLang라면 이를 통해서도 동일한 결과를 얻을 수 있습니다.
spark-vllm-docker 프로젝트에는 클러스터를 시작하고 모델을 클러스터 전체에 분산시키는 작업을 쉽게 만들어주는 몇 가지 유용한 스크립트가 포함되어 있으며, sparkrun 프로젝트도 유사한 기능을 제공합니다. 이번 테스트 회차에서는 spark-vllm-docker에 집중했지만, 다른 옵션을 탐색하고 싶다면 이 분야에 다양한 선택지가 있습니다.
추론 엔진을 결정한 후, 우리는 클러스터에서 사용 가능한 256GB VRAM의 상당 부분을 활용할 수 있는 고급 모델을 찾아 나섰습니다.
DeepSeek v4 Flash가 바로 그러한 모델 중 하나입니다. 이 모델은 2,840억 개의 파라미터를 가진 전문가 혼합 (Mixture of Experts, MoE) 모델로, 토큰당 180억 개의 활성 파라미터를 가지며, 최대 100만 토큰의 컨텍스트 창 (Context Window)을 지원한다고 주장합니다. (vLLM은 이 설정에서 400K 토큰 제한을 제공했습니다). spark-vllm-docker는 이 모델을 위한 사전 구성된 vLLM 레시피를 제공하므로, 우리는 이를 다운로드하여 클러스터에 배포하고 벤치마킹을 시작했습니다.

Tom's Hardware

Tom's Hardware
우리가 사용한 DeepSeek v4 Flash vLLM 레시피는 이 모델의 내장된 다중 토큰 예측 (Multi-token Prediction) 기능을 활용합니다. 따라서 컨텍스트 길이가 200K+ 토큰(A4 용지 약 333페이지 분량)까지 늘어나 첫 번째 토큰 생성 시간 (Time to First Token)이 증가하더라도 디코딩 처리량 (Decoding Throughput)은 본질적으로 동일하게 유지됩니다. 이는 이 정도 규모와 성능을 가진 모델로서 매우 인상적이며 실용적인 성능입니다.
우리는 또한 CyanKiwi의 MiniMax M2.7 4비트 양자화 (four-bit quantization) 버전을 로드했습니다. 이것은 총 2,300억 개의 파라미터와 100억 개의 활성 파라미터 (active parameters)를 가진 또 다른 대규모 전문가 혼합 (Mixture-of-Experts, MoE) 모델이며, 최대 200K 토큰의 컨텍스트 윈도우 (context window)를 지원합니다. 이는 우리가 Spark 클러스터에서 초기화한 후 vLLM을 통해 얻은 결과와 정확히 일치합니다.

Tom's Hardware

Tom's Hardware
이 모델은 DeepSeek v4가 가진 내장된 MTP (Multi-Token Prediction) 이점이 없기 때문에, 이번 테스트에 사용한 4비트 양자화 (four-bit quantization)를 적용했음에도 불구하고 첫 번째 토큰 생성 시간 (time-to-first-token)과 초당 토큰 수 (tokens-per-second) 처리량 (throughput)은 더 익숙한 곡선을 따릅니다. 처리량은 비교적 사용 가능한 범위에서 시작되지만, 컨텍스트 윈도우 (context window)의 한계에 도달함에 따라 빠르게 떨어집니다.
DeepSeek v4 Flash와 MiniMax 2.7을 실행해 본 결과, Spark 클러스터가 빠르지는 않더라도 이러한 고사양 모델들을 활용하여 유용한 샌드박스 (sandbox)로 사용할 수 있을 만큼 충분한 초당 토큰 수를 생성할 수 있음을 확인했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Tom's Hardware의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기