
NVIDIA DGX Spark를 데일리 드라이버로 사용하기
요약
NVIDIA DGX Spark를 데일리 드라이버로 사용한 실사용 리뷰입니다. ARM CPU와 RTX 5070급 GPU, 128GB 통합 메모리를 탑재하여 뛰어난 전력 효율과 성능을 보여줍니다.
핵심 포인트
- ARM 기반의 높은 전력 효율과 저소음 설계
- M3 Pro 및 Ryzen 9과 대등한 수준의 CPU 성능
- 128GB 통합 메모리 및 4TB SSD 탑재
- Crysis와 같은 게임도 실행 가능한 준수한 GPU 성능
저는 NVIDIA DGX Spark를 구매했습니다! 이 기기는 매우 작고 전력 효율적이면서도 실제로 상당히 유능한 범용 컴퓨터입니다. 기본적으로 ARM CPU, 괜찮은 수준의 NVIDIA GPU (RTX 5070과 동일한 수의 CUDA 코어 탑재), 128 GB의 통합 메모리 (unified memory), 그리고 4 TB SSD를 갖추고 있습니다.

그림 1 DGX Spark 옆에 놓인 저의 소형 폼 팩터 (small form factor) PC.
EXIF 데이터
- 카메라
- FUJIFILM GFX100S
- 렌즈
- 125
- 조리개
- f/NaN
- 셔터
- 1.7 s
- ISO
- ISO 100
- 소프트웨어
- darktable 5.5.0+1325~g5f523d43b6
- 날짜
다운로드
면책 조항: 저는 NVIDIA에서 근무하지만, 이 제품은 제 사비로 구매했으며 의견은 저 개인의 것입니다. 이 리뷰를 작성함으로써 어떠한 대가도 받지 않았습니다. 제가 DGX Spark를 구매했을 때는 4,000달러였으나, 이후 가격이 4,700달러로 인상되었습니다.
DGX Spark는 “DGX OS”를 실행하지만, 사실상 몇 가지 추가 사항이 포함된 평범한 Ubuntu 24.04일 뿐입니다. 원한다면 다른 Linux 배포판을 쉽게 설치할 수 있지만 (Fedora가 잘 작동합니다), Realtek 이더넷 (Ethernet) 드라이버와 관련하여 몇 가지 이상한 버그가 있을 수 있어 NVIDIA 버전의 Linux 커널에는 몇 가지 패치가 적용되어 있습니다. 다른 일부 ARM 장치들과 달리, DGX Spark는 디바이스 트리 (device tree) 기반이 아닌 ACPI 기반이므로, arm64용 일반 Linux 빌드가 아주 잘 작동합니다.
일반적으로 전력 효율이 높고 조용한 박스입니다 (부하가 걸릴 때는 약간의 소리가 들리지만 짜증 나는 고주파음은 없으며, 유휴 상태(idle)일 때는 무음입니다). 방을 뜨겁게 만들거나 소음을 내지 않는다는 점이 정말 좋습니다. 웹 브라우징이나 일반적인 프로그래밍 작업 같은 것들은 매우 빠릅니다.
CPU의 Geekbench 6 점수는 M3 Pro 14 코어 및 AMD Ryzen 9 7950X와 거의 대등한 수준입니다: 싱글 코어 2983, 멀티 코어 18183. 이상하게도 제 결과는 동일한 GB10을 사용하는 Geerlingguy의 Dell Pro Max보다 약간 낮게 나왔습니다. 아마도 단순히 발열(thermals) 문제이거나 무작위 변동 때문일 것입니다. 어쨌든, 2869점과 16973점을 기록한 AMD Ryzen 9 7945HX 탑재 SFFPC보다는 성능이 좋습니다.

그림 2 Fastfetch 시스템 사양.
다운로드
1 Crysis를 실행할 수 있을까?
결과적으로, Crysis를 완벽하게 실행할 수 있었습니다. 사실 DGX Spark는 게임 성능도 꽤 괜찮은 편입니다.

그림 3 네, Crysis를 실행할 수 있습니다!
EXIF 데이터
- 카메라
- FUJIFILM GFX100S
- 렌즈
- SIGMA 70mm F2.8 DG MACRO A018
- 조리개
- f/2.8
- 셔터 속도
- 1/70 s
- ISO
- ISO 1600
- 소프트웨어
- darktable 5.5.0+1479~g9e36df0344
- 날짜
다운로드
이것은 모든 설정을 High로, DLSS를 Performance로 설정한 상태에서 3200 x 1800 해상도로 실행 중인 Crysis Remastered입니다. 이 게임은 ProtonDB에서 플래티넘(platinum) 등급을 받았지만, NVIDIA 그래픽을 사용하는 다른 사용자들과 마찬가지로 제대로 작동시키기 위해 Proton 버전을 Experimental로 설정해야 했습니다.
arm64용 Steam Snap은 Canonical에서 관리하며 특히 DGX Spark에서의 게임 플레이를 타겟으로 합니다. 아마도 대부분의 게임을 플레이할 수 있는 가장 좋은 방법일 것입니다. 이는 FEX를 사용하여 x86_64를 arm64로 변환하며, Apple 기기의 Rosetta 2와 유사한 역할을 수행합니다. 또한 DLSS, RTX 등을 포함하고 있어 레이 트레이싱 (Ray Tracing)을 켠 상태로 최신 AAA 타이틀을 플레이할 수 있을 것으로 기대할 수 있습니다.
물론, 전용 게이밍 머신과 비교했을 때 "가성비 (bang for the buck)"는 좋지 않습니다. 결국 DGX Spark는 상당히 비싸니까요. 아마 게임만을 위해 DGX Spark를 구매하고 싶지는 않을 것입니다. NVIDIA 전용 그래픽 카드가 장착된 저의 소형 폼 팩터 (Small Form Factor) PC가 더 낮은 가격으로 게임 성능이 더 좋습니다.
DGX Spark의 GPU는 RTX 5070과 어느 정도 비교할 만하지만, 메모리 대역폭 (Memory Bandwidth)이 훨씬 느리고 전력 소모도 훨씬 낮으며, FEX로 인한 오버헤드가 존재합니다 (Proton의 성능 저하는 보통 매우 미미하거나, 때로는 Proton에서 게임이 Windows보다 더 빠른 경우도 있지만 말입니다). 따라서 성능은 약 3분의 2 정도를 기대할 수 있습니다.
다음과 같은 훌륭한 그래픽을 가진 많은 최신 Steam 게임들이 별도의 설정 없이도 잘 작동합니다:
- Cyberpunk 2077
- Portal RTX
- Indiana Jones and the Great Circle
- Running Train
그리고 그 외에도 많이 있습니다! 일반적으로 Unreal, Unity, Godot와 같은 일반적인 게임 엔진을 사용하는 최신 게임들은 RTX 및 DLSS와 같은 부가 기능들도 작동하며, 바로 실행될 가능성이 매우 높습니다.

그림 4 Cyberpunk 2077 벤치마크 결과.
다운로드

그림 5 달리는 기차.
EXIF 데이터
- 카메라
- Apple iPhone 14 Pro Max
- 렌즈
- iPhone 14 Pro Max 후면 트리플 카메라 6.86mm f/1.78
- 조리개
- f/1.8
- 셔터 속도
- 1/121 초
- ISO
- ISO 100
- 소프트웨어
- 26.6
- 날짜
다운로드
작동하지 않는 게임의 주요 카테고리는 다음과 같습니다:
- League of Legends와 같이 Linux에서 작동하지 않는 공격적인 안티치트 (anticheat)를 사용하는 게임
- 작동시키기 위해 약간의 손질 (tinkering)이 필요한 일부 오래된 게임 (손질이 필요한 소프트웨어 섹션 참조)
- Steam 이외의 플랫폼 게임은 작동할 확률이 더 낮음
2 로컬 LLM 추론 (Local LLM inference)
대부분의 사람들이 DGX Spark를 구매하는 주요 이유는 아마도 로컬 LLM 추론을 시도해 보기 위해서일 것입니다. DGX Spark가 이 측면에서 마치 잘 숙성된 와인처럼 시간이 흐를수록 더 좋아지고 있다는 소식을 전하게 되어 기쁩니다!
초기 리뷰에서는 (메모리 대역폭에 의한 병목 현상으로 인해) 성능이 평범하다는 비판을 받기도 했지만, 수많은 새로운 기술들이 적용되면서 출시 초기보다 말 그대로 몇 배나 더 빨라졌습니다!
- NVFP4가 엄청난 성능 향상을 가져왔습니다. 출시 당시에는 DGX Spark에서 지원되지 않아 매우 아쉬웠으나, 곧 지원되기 시작했습니다.
- NVFP4 KV-캐시 양자화 (KV-cache quantization)는 첫 번째 토큰 생성 시간 (time-to-first-token)을 크게 단축했습니다.
- 멀티 토큰 예측 (Multi-token prediction)은 많은 모델에서 최대 2배의 무료 속도 향상을 제공합니다.
- NVIDIA Model Optimizer는 양자화된 모델에 또 다른 큰 성능 향상을 제공했습니다. 그 결과 2026-06-30에 이전 양자화 버전보다 훨씬 빠르고 성능이 뛰어난 Qwen 3.6 27B 버전이 출시되었습니다.
- DFlash는 확산 기반 초안 작성기 (diffusion-based drafter)를 사용하여 미래의 토큰 블록 전체를 한 번에 예측함으로써, 투기적 디코딩 (speculative decoding)을 더욱 개선했습니다.

그림 6 NVIDIA는 2026-06-30에 Qwen 3.6 27B의 새로운 양자화 버전을 출시했습니다.
다운로드
레시피와 벤치마크가 포함되어 있어 상당히 유용한 Spark Arena 리더보드가 있습니다.
어쨌든, 현재 Qwen 3.6 27B dense 모델의 NVFP4 양자화 (quantization) 버전을 사용하면 초당 약 30-40 토큰 (단일 동시성, 단일 Spark 기준)을 기대할 수 있으며, 이는 일상적인 프로그래밍에 매우 유능한 수준입니다. 일반적인 코딩과 에이전트 자동화 (agentic automation)에 상당히 유용합니다. 동시성 레벨 4 (예를 들어 4개의 에이전트가 병렬로 실행되는 경우)에서는 초당 총 약 100 토큰의 출력 속도를 기대할 수 있습니다.
Qwen 3.6 35B MoE (Mixture-of-Experts) 모델의 경우, 디코딩 (decode) 속도가 초당 최대 약 170 토큰에 달할 정도로 훨씬 빠른 성능을 기대할 수 있습니다. 이는 코딩 능력은 약간 떨어질 수 있지만, 빠른 채팅과 자동화에는 믿을 수 없을 정도로 유용합니다.
3 손질이 필요했던 소프트웨어 3가지
3.1 Darktable
Darktable의 arm64 빌드는 즉시 작동하지만, 매우 느립니다. NVIDIA 드라이버(최소한 테스트된 버전 580 기준)에 문제가 있는 것으로 보이는데, Darktable의 OpenCL 파이프라인 (pipeline)에서 GPU에서 CPU로 데이터를 전송하는 속도가 매우 느립니다. 이는 앱 내 상호작용과 내보내기 (export) 속도 모두에 영향을 미칩니다.
저는 이 문제를 해결하는 “prefault OpenCL readback destinations”라는 풀 리퀘스트 (pull request)를 생성했습니다. “preheat host memory for OpenCL”이라는 풀 리퀘스트 또한 아마도 조금 더 나은 방식으로 이 문제를 해결합니다 (이 PR은 되돌려졌기 때문에, 수정 사항은 아직 Darktable 메인라인에 반영되지 않았습니다).
3.2 Rhinoceros 3D
Rhinoceros 3D는 Windows x86_64 및 macOS (Apple Silicon 기반)용 3D 모델링 애플리케이션입니다. 저는 라이선스를 구매하여 라인 스캔 카메라 케이스와 같은 다른 프로젝트에 사용했습니다. 불행히도, 최신 버전은 Linux에서 작동하지 않는 것으로 잘 알려져 있으며, Rhino 포럼에는 이에 대한 불만 섞인 스레드가 있습니다.
Windows 버전을 작동시키는 것이 일반적으로 macOS 버전보다 더 간단한 것으로 간주됩니다.
어쨌든, 저는 Codex에게 이를 작동시켜 달라고 요청했고, 실제로 해냈습니다! 다음은 AI가 생성한 지침입니다:

그림 7 나의 컨셉 카 “Pupple” 렌더링.
다운로드

그림 8 NVIDIA Optix가 작동 중입니다.
다운로드
참고: Wine은 AI가 생성한 코드를 수용하지 않으며, 저는 이곳의 수정 사항들에 대해 충분한 지식이 없기 때문에 제가 패치한 포크(fork)를 업스트림(upstream)에 반영할 수는 없습니다.
3.3 Need for Speed Porsche Unleashed
Need for Speed Porsche Unleashed는 제가 역대 가장 좋아하는 비디오 게임 중 하나입니다. 초등학생 때 정말 많이 플레이했기에 다시 플레이할 때면 엄청난 향수를 느낍니다. "인플루언서의 목소리"와 같은 방해 요소 없이, 꽃가루나 광고판, 램프(ramps) 등을 경험하며 아름다운 유럽 거리를 그저 드라이빙하는 것에는 특별한 무언가가 있습니다. 동시에, 타이어와 체인 링크 울타리, 광고들로만 둘러싸인 레이저 스캔 트랙 위의 초하드코어 레이싱 심(sim)들에 비하면, 이 예쁜 분위기는 매우 여유롭습니다.

그림 9 차고 뷰(garage view)는 창 크기에 따라 종횡비(aspect ratio)가 맞지 않지만, 뭐 어쩔 수 없죠.
다운로드

그림 10 6144x3456 해상도로 실행 중인 Porsche Unleashed.
다운로드
결과적으로, ARM64EC 호환성 백엔드(compatibility backend)로 FEX를 사용하는 arm64용 메인라인(mainline) Wine에서 아주 잘 작동합니다. 저는 Verok의 패치를 설치하고 OpenGL3 렌더러(renderer)를 사용했는데, 아주 잘 작동합니다! 이제 그래픽은 원본 게임(1024x768 같은 매우 낮은 해상도로만 실행되었던)보다 훨씬 더 좋아졌습니다.
한 가지 이상한 특징: GB10에는 10개의 빠른 Cortex-X925 코어와 10개의 느린 Cortex-A725 코어가 있습니다. 저는 이를 10개의 느린 코어가 아닌 10개의 빠른 코어에 명시적으로 고정(pin)해야 했습니다. 그렇지 않으면 프레임 레이트(framerate)가 매우 낮아지기 때문입니다. 제 생각에는 아마도 1999년의 게임이라 리소스를 너무 적게 사용하여 스케줄러(scheduler)가 실시간(real time)으로 실행되어야 한다는 것을 인지하지 못하는 것 같습니다.
Windows 11에서는 Verok의 패치를 작동시키는 데 엄청난 어려움을 겪었는데, Windows가 이를 계속 악성 코드(malware)로 분류했기 때문입니다. 정말 말도 안 될 정도로 많은 우회 과정을 거쳐야 했습니다. 예외 항목으로 추가하기 위해 마우스 오른쪽 버튼을 클릭하려고 할 때마다, OS가 이를 조용히 삭제해 버렸습니다. 정말 좌절스러웠습니다. DGX Spark에서 작동시키는 것은 그에 비하면 상당히 수월했습니다. 실제로 악성 코드가 포함되어 있는지는 알 수 없으므로, 사용 시 발생하는 위험은 본인이 감수하시기 바랍니다 (개인적으로는 안전하다고 생각합니다).
3.4 StarCraft II
Rhino 3D 때와 마찬가지로, Codex에게 작동 방법을 도와달라고 요청했습니다. SC2는 일반적인 x86_64 머신에서 Proton이나 Wine을 통해 잘 작동하지만, arm64에서는 시작 시 충돌(crash)이 발생했습니다. 어쨌든, 이를 작동시키기 위해 AI가 생성한 지침은 다음과 같습니다:

그림 11 Starcraft II의 설정 메뉴.
Download

그림 12 프레임레이트(Framerate)는 85 fps입니다.
Download
Rhino와 마찬가지로, Wine은 AI가 생성한 코드를 수용하지 않으며, 저는 이 수정 사항들에 대해 충분한 지식이 없기 때문에 제가 패치한 포크(fork)를 업스트림(upstream)할 수는 없습니다.
4 커스텀 선반 (A custom shelf)
DGX Spark에는 4개의 USB-C 포트(그 중 하나는 전원 공급용)가 있습니다. 저는 DGX Spark를 다음과 같은 것들로 보강하고 싶었습니다:
- 키보드, 마우스, 마이크 등을 위한 더 많은 USB 포트
- 가지고 있는 여분의 NVMe M.2 2280 SSD
- SD 카드 리더기
그래서 저는 상당히 평판이 좋은 ASMedia ASM2464PD 칩과 괜찮아 보이는 히트싱크(heatsink)를 갖추고, 빠른 USB4 연결을 지원하며 위의 모든 기능을 포함하는 Hagibis의 Mac Mini M4 독(dock)을 구매했습니다. 이것은 다시 마우스, 키보드, 오디오, 마이크가 연결된 4포트 USB 3.0 스위칭 독에 데이지 체인(daisy-chained)으로 연결되어 있으며, 이 독은 제 MacBook(업무용)으로도 쉽게 전환할 수 있습니다.
결과적으로 DGX Spark의 4개 USB-C 포트는 다음과 같이 사용되었습니다:
- 전원
- 24 TB 드라이브 4개로 구성된 나의 4개 하드 드라이브 USB 3.2 ZFS raidz2 어레이
- Hagibis 독 (SSD 연결)
- Hagibis 독 (그 외 모든 것)
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Posts의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기