RTX 5090 4장으로 로컬 AI 구성하기
요약
본 기사는 로컬 AI 환경 구축 시 VRAM 용량 부족과 물리적 슬롯 한계를 극복하는 방법을 다룹니다. 일반적인 데스크톱의 공간 제약을 넘어, 그래픽카드를 케이스 외부에 두고 Thunderbolt 케이블로 연결하여 RTX 5090 네 장을 구성했습니다. 이를 통해 시스템의 VRAM을 128GB까지 확장할 수 있음을 보여줍니다.
핵심 포인트
- VRAM 용량 확보가 로컬 AI 구동의 핵심 병목 지점입니다.
- 대형 그래픽카드 사용 시 물리적 슬롯 공간 부족 문제가 발생합니다.
- 케이스 외부에 GPU를 배치하고 Thunderbolt로 연결하는 대안이 제시됩니다.
- 이를 통해 시스템 전체 구성 변경 없이 VRAM을 확장할 수 있습니다.
RTX 5090 4장으로 로컬 AI 구성하기
AI라는 단어를 두고 이렇게까지 고민하는 시기가 올 줄은 몰랐습니다. 기술이 발전하는 속도를 보고 있으면 앞으로 어떤 모습이 될지 쉽게 그려지지 않습니다. 하드웨어 커뮤니티에서 새로운 변화를 빠르게 접해온 입장에서도 마찬가집니다. 그래서 최근에는 직접 로컬 AI 환경을 구성해 여러 모델을 올려봤습니다. 처음에는 무엇을 어떻게 돌려야 하는지도 몰라 검색부터 시작했고, 테스트 방법을 찾아가며 하나씩 확인했습니다. 그렇게 몇 번 모델을 올려보니 성능보다 먼저 부딪히는 문제가 있었습니다. VRAM입니다.
로컬에서 AI 모델을 구동하려면 모델 데이터를 그래픽카드 VRAM에 담아야 합니다. 용량이 부족하면 아무리 성능이 좋은 그래픽카드라도 원하는 모델을 온전히 올릴 수 없습니다. 5090 한 장의 32GB에서 두 장의 64GB로 늘렸을 때는 선택할 수 있는 모델이 확실히 많아졌지만, 곧 다음 문제가 나타났습니다. 그래픽카드를 더 꽂을 슬롯이 없다는 것입니다.
일반적인 데스크톱 환경에서 5090 두 장을 장착하면 사실상 선택지가 좁아집니다. 덩치가 큰 비레퍼런스 그래픽카드가 슬롯을 차지하기 때문에 세 번째 카드를 추가하기가 어렵고, 더 많은 카드를 사용하려면 메인보드부터 케이스와 전원 구성까지 다시 생각해야 합니다.
그렇다면 그래픽카드를 반드시 메인보드 슬롯 안에 넣어야 할까요. 이번에 확인해본 방법은 조금 달랐습니다. 그래픽카드를 케이스 밖으로 빼고, 썬더볼트 케이블로 연결하는 방식입니다. 슬롯에 5090 두 장을 그대로 둔 상태에서 GIGABYTE AORUS RTX 5090 AI BOX 두 대를 추가해, 그래픽카드 네 장을 하나의 시스템에서 구성했습니다.
결과적으로 32GB였던 VRAM은 64GB를 거쳐 128GB까지 늘어났습니다. 중요한 것은 단순히 VRAM 용량을 늘렸다는 데 있지 않습니다. 일반적인 데스크톱에서는 슬롯이 먼저 막히는 상황에서, 케이블을 더하는 것만으로 그래픽카드 두 장을 시스템 밖에서 추가할 수 있다는 점입니다.
이번 테스트에서는 실제로 RTX 5090 네 장이 모두 인식되는지부터 확인하고, 네 장을 연결했을 때 어떤 모델까지 올릴 수 있는지, 썬더볼트로 연결한 카드가 메인보드 슬롯에 직접 꽂은 카드와 어느 정도 차이를 보이는지까지 확인해봤습니다.
목차
−
1
더 이상 장착할 공간이 없다
2
테스트 시스템 구성
3
GPU를 늘리면 속도는 어떨까?
4
VRAM이 커지면 어떤 모델까지 올라갈까?
5
128GB를 넘기면 어떻게 될까?
6
썬더볼트로 연결하면 느려질까?
7
카드마다 다른 모델을 동시에
8
4장을 모두 돌리면 전력은
9
같은 128GB를 다른 방법으로 산다면
10
마치며
더 이상 장착할 공간이 없다
5090 두 장을 사용하면서 VRAM은 32GB에서 64GB로 늘었습니다. 문제는 여기서부터입니다. 그래픽카드를 한 장 더 추가하려고 해도 일반적인 데스크톱에서는 장착할 자리가 마땅하지 않습니다. 원인은 그래픽카드 크기입니다. RTX 5090은 모델에 따라 두꺼운 방열판을 사용하며, 실제로 테스트에 사용한 제품도 약 65mm 두께에 342mm 길이입니다. 3 슬롯이 넘는 구조라 두 장을 나란히 장착하면 메인보드 아래쪽 확장 슬롯까지 영향을 받습니다.
그렇다고 그래픽카드를 더 얇은 제품으로 바꾸는 것만으로 해결되는 문제도 아닙니다. 그래픽카드 사이 간격을 확보할 수 있는 메인보드가 필요하고, 여러 장의 대형 그래픽카드를 수용할 수 있는 케이스와 전원 구성도 함께 고려해야 합니다. 결국 그래픽카드 한 장을 더 추가하려다가 시스템 전체 구성이 달라질 수 있습니다. 여기서 방향을 바꿔볼 수 있습니다. 그래픽카드를 반드시 메인보드 슬롯 안에 넣어야 할 이유가 없다면 어떨까요.
GIGABYTE AORUS 지포스 RTX 5090 AI BOX D7 32GB 제이씨현은 그래픽카드를 케이스 밖에서 추가로 장착하는 방식입니다. 그래픽카드 자체는 외장 박스 안에 들어가고, 메인 시스템과는 썬더볼트 케이블로 연결합니다. 따라서 메인보드 PCIe 슬롯을 추가로 사용하지 않습니다. 이번 테스트에서는 메인보드에 RTX 5090 두 장을 그대로 장착한 상태에서 AI BOX 두 대를 추가했습니다. 슬롯에 직접 연결된 두 장과 외부에서 케이블로 연결된 두 장을 합쳐 하나의 시스템에서 RTX 5090 네 장을 구성하는 것입니다.
테스트 시스템 구성
테스트 시스템은 썬더볼트 5를 지원하는 인텔 Z890 플랫폼으로 구성했습니다. GIGABYTE 지포스 RTX 5090 WINDFORCE OC D7 32GB 제이씨현은 메인보드 슬롯에 두 장을 장착하고, 나머지 두 장은 GIGABYTE AORUS 지포스 RTX 5090 AI BOX D7 32GB 제이씨현 두 대로 연결했습니다. 시스템 메모리는 192GB로 구성했는데, 이는 VRAM을 넘어서는 모델을 실행했을 때 시스템 메모리까지 활용할 수 있도록 여유를 둔 것입니다.
로컬 LLM 추론에는 llama.cpp b11029를 사용했으며, CUDA 버전은 13.4입니다. 윈도우용 버전을 사용해 별도의 복잡한 설정 없이 실행하는 환경으로 구성했습니다.
모델은 4비트 양자화, Unsloth GGUF 형식으로 통일했습니다. 32GB 구간에서는 Gemma 4 31B를 사용하고, 96GB와 128GB 구간에서는 177B MoE 모델인 Qwen3.8-Flash-Next를 사용했습니다. 128GB를 넘어서는 모델을 확인하기 위해서는 284B 모델인 DeepSeek V4-Flash를 추가로 사용했으며, 각 그래픽카드에서 서로 다른 모델을 동시에 구동하는 테스트에는 Qwen3-Coder-30B와 Qwen3.8-27B를 사용했습니다.
■테스트 시스템
RTX 5090 네 장 · 슬롯 2 + AI BOX 2 · VRAM 합계 128GB
시스템 구성
CPU
Intel Core Ultra 7 270K Plus
메인보드
GIGABYTE Z890 AORUS XTREME AI TOP
메모리
BIWIN ORIGIN CODE DDR5-6000 CL26 VORTEX 192GB(48GBx4)
저장장치
솔리다임 P44 Pro M.2 NVMe (2TB)
파워
SuperFlower SF-2800F14HP LEADEX TITANIUM ATX3.1
케이스
darkFlash WS700X
그래픽카드
메인보드 슬롯
GIGABYTE 지포스 RTX 5090 WINDFORCE OC D7 32GB 제이씨현 ×2
PCIe 5.0 x8/x8
AI BOX
GIGABYTE AORUS 지포스 RTX 5090 AI BOX D7 32GB 제이씨현 ×2
썬더볼트 5 · 자체 전원
VRAM 합계
128GB
소프트웨어
OS
Windows 11 (빌드 26200)
그래픽 드라이버
NVIDIA GeForce Game Ready 616.92
추론 엔진
llama.cpp b11029 · CUDA 13.4
모델 형식
Unsloth GGUF · 4비트 양자화
연결은 간단합니다. AI BOX를 썬더볼트 포트에 연결하고 부팅하면 됩니다. 메인보드에 RTX 5090 두 장을 이미 장착한 상태에서 AI BOX 두 대를 추가했는데, 네 장 모두 정상적으로 인식됐습니다. AI BOX에 연결된 그래픽카드는 Resizable BAR를 사용할 수 없어 BAR1이 256MB로 제한됩니다. 썬더볼트 연결에 따른 제약으로, 이후 테스트도 같은 조건에서 진행했습니다.
GPU를 늘리면 속도는 어떨까?
이번 테스트는 RTX 5090 한 장으로도 충분히 올라가는 모델을 선정했습니다. 한 장에 들어가는 모델을 굳이 여러 장에 나눠 담으면 어떻게 될까요. 같은 Gemma 4 31B를 1장부터 4장까지 나눠서 속도를 측정해 봤습니다.
■GPU를 늘리면 빨라질까?
Gemma 4 31B (Q4_K_M · 17.05GiB) · Unsloth GGUF · llama.cpp b11029
📤 토큰 생성 속도
실제 답변이 출력되는 속도 (t/s) · 카드가 늘수록 완만하게 하락
1장
71.8
2장
70.0
3장
67.8
4장
61.0
📥 프롬프트 처리 속도
긴 입력을 읽어들이는 속도 (t/s) · 2장에서 정점 후 하락
1장
2,922
2장
5,177
3장
4,132
4장
3,533
⚡ 카드를 늘려도 답변 생성은 오히려 느려집니다. GPU 추가는 속도가 아니라 용량을 위한 선택입니다.
결과는 두 방향으로 갈립니다. 답변을 뽑아내는 토큰 생성 속도는 카드가 늘수록 오히려 떨어집니다. 한 장에서 71.8 t/s이던 것이 네 장에서는 61.0 t/s까지 내려갑니다. 한 모델을 여러 장에 나눠 담으면 카드끼리 결과를 넘겨주는 시간이 쌓이기 때문입니다. 다만 3·4번째 카드는 AI BOX라, 이 구간의 수치에는 카드 수 증가와 썬더볼트 연결이 함께 반영돼 있습니다.
반대로 긴 입력을 읽어들이는 프롬프트 처리 속도는 2장에서 정점을 찍습니다. 한 장 대비 77%나 뛰어오릅니다. 이 작업은 연산이 한꺼번에 몰리는 구간이라 카드를 나눠 쓰는 쪽이 유리합니다.
정리하면 이렇습니다. 카드를 늘리는 목적은 속도가 아닙니다. 한 장에 담기지 않는 큰 모델을 올리기 위해서입니다. 이 점을 염두에 두고 본격적으로 용량을 키워보겠습니다.
VRAM이 커지면 어떤 모델까지 올라갈까?
카드를 늘려 확보한 VRAM에 실제로 어떤 크기까지 올라가는지 구간별로 확인했습니다.
■VRAM 용량별로 올라가는 모델
4비트 양자화 · Unsloth GGUF · llama.cpp b11029
32GB
RTX 5090 1장
모델
Gemma 4 31B
덴스 · Q4_K_M
파일 크기
17.05GiB
생성 속도
71.8 t/s
96GB
RTX 5090 3장
모델
Qwen3.8-Flash-Next
177B MoE · IQ4_XS
파일 크기
87.24GiB
생성 속도
101.1 t/s
128GB
RTX 5090 4장
모델
Qwen3.8-Flash-Next
177B MoE · Q4_K_XL (상위 양자화)
파일 크기
103.68GiB
생성 속도
68.2 t/s
⚡ VRAM이 커질수록 더 큰 모델, 또는 같은 모델을 더 높은 정밀도로 올릴 수 있습니다.
32GB, 그러니까 5090 한 장으로는 Gemma 4 31B가 들어갑니다. 구글이 내놓은 300억 파라미터 급 모델로, 4비트로 누르면 17GiB 남짓이라 한 장에 여유 있게 올릴 수 있습니다. 71.8 t/s를 뽑아내니 속도도 넉넉합니다.
96GB, 카드 세 장부터는 이야기가 달라집니다. 알리바바의 Qwen3.8-Flash-Next가 올라가는데, 총 1,770억 파라미터에 이르는 대형 모델입니다. 여기서 흥미로운 장면이 나옵니다. 다섯 배 넘게 큰 이 모델이 앞선 31B보다 오히려 빠릅니다. 101 t/s입니다. 비결은 MoE 구조에 있습니다. 이 모델은 1,770억 파라미터를 전부 쓰지 않습니다. 토큰 하나를 만들 때마다 그중 60억 개만 골라서 작동시킵니다. 덩치는 크지만 매 순간 움직이는 부분은 작으니, 파일 크기에 비해 훨씬 가볍게 돌아가는 것입니다.
128GB, 네 장을 모두 채우면 같은 Qwen3.8-Flash-Next를 한 단계 높은 정밀도로 올릴 수 있습니다. 카드 세 장일 때보다 양자화를 덜 눌러 품질을 끌어올린 구성입니다. 대신 파일이 커지고 카드도 한 장 늘어난 만큼 속도는 68 t/s로 내려갑니다. 용량에 여유가 생기면 더 큰 모델을 넣거나, 같은 모델을 더 좋은 품질로 돌리거나, 둘 중 하나를 고를 수 있다는 뜻입니다.
여기서 오해하지 말아야 할 부분이 있습니다. 구간마다 속도가 다른 것은 VRAM 용량 자체보다 올린 모델과 양자화, 카드 구성이 달라서입니다. VRAM은 속도를 올리는 장치가 아니라, 더 큰 모델을 담을 그릇입니다. 그릇이 커질수록 담을 수 있는 것이 많아질 뿐입니다.
128GB를 넘기면 어떻게 될까?
128GB까지는 VRAM 안에 모델을 담을 수 있었습니다. 그렇다면 이 한계를 조금 넘어서는 모델은 어떨까요. 2,840억 파라미터의 DeepSeek V4-Flash를 올려봤습니다. 4비트로 양자화해도 144GiB로, 네 장을 합친 VRAM(약 127GiB)보다 17GiB가량 큽니다.
그냥 실행하면 llama.cpp가 알아서 나눕니다. VRAM에 담을 수 있는 만큼 올리고, 넘치는 부분은 시스템 램으로 흘립니다. 그리고 놀랍게도, 돌아갑니다. 2,840억 파라미터짜리 모델이 데스크톱 한 대에서 또박또박 답을 써 내려갑니다.
■VRAM을 넘기면 무슨 일이 생기나
RTX 5090 4장 · 4비트 양자화 · Unsloth GGUF · llama.cpp b11029 · 생성 속도(t/s) 실측
VRAM에 전부 상주
Qwen3.8-Flash-Next 177B · 103.68GiB · VRAM 점유 128GB 이내
68.2 t/s — 읽는 속도의 약 9배
68.2
VRAM 초과, 시스템 램으로
DeepSeek V4-Flash 284B · 144.44GiB · VRAM 128GB + 램 오프로드
23.5 t/s — VRAM 상주 모델의 약 3분의 1
23.5
⚡VRAM을 넘기면 모델 일부가 시스템 메모리로 넘어가 속도가 크게 떨어집니다. VRAM과 시스템 메모리의 대역폭이 20배 가까이 차이 나기 때문입니다. 두 모델은 활성 파라미터(6B·13B)가 달라 수치를 그대로 비교할 수는 없습니다.
속도는 23.5 t/s로, VRAM에 모두 담긴 Qwen3.8-Flash-Next(68.2 t/s)의 3분의 1 수준입니다. 실제 점유량으로 따지면 모델의 20% 이상이 시스템 메모리에 얹힌 상태입니다. 다만 두 모델은 토큰 하나를 만들 때 쓰는 파라미터가 6B와 13B로 두 배 넘게 달라, 이 격차가 전부 오프로드 탓은 아닙니다. 그래도 VRAM(약 1.8TB/s)과 듀얼 채널 DDR5(약 96GB/s)의 대역폭이 20배 가까이 벌어지는 만큼, 모델 일부가 시스템 메모리로 넘어가면 속도가 크게 꺾이는 건 피하기 어렵습니다.
그렇다고 오프로드를 실사용할 수 없다는 뜻은 아닙니다. 23.5 t/s에서도 모델과 대화하는 것 자체는 가능하며, 중요한 것은 VRAM에 모두 담을 수 없는 더 큰 모델을 실행할 수 있다는 점입니다. 다만 VRAM 안에 모델을 담았을 때와 같은 속도를 기대하기는 어렵습니다. 결국 이번 구성에서 128GB는 절대적인 한계라기보다, 속도와 모델 크기 사이에서 선택이 필요한 경계선에 가깝습니다.
썬더볼트로 연결하면 느려질까?
그렇다면 썬더볼트로 연결한 그래픽카드는 슬롯에 직접 장착한 그래픽카드보다 얼마나 느릴까요. 앞선 수치들은 슬롯 카드와 외장 카드가 뒤섞인 값이라, 순수한 차이를 보려면 조건을 갈라야 합니다. 그래서 같은 Gemma 4 31B를 카드 한 장에만 올리고, 연결 방식만 바꿔가며 측정했습니다.
■메인보드 슬롯 vs 썬더볼트 외장, 성능 차이
Gemma 4 31B (Q4_K_M · 17.05GiB) · Unsloth GGUF · llama.cpp b11029
메인보드 슬롯 직결 (기준)
AI BOX 썬더볼트 5 연결
여유 조건
컨텍스트 32K · VRAM 점유 72% · 일반적인 사용 상황
📥 프롬프트 처리 속도 (t/s, 높을수록 빠름)
메인보드 슬롯
2,922
AI BOX (썬더볼트)
2,852
📤 토큰 생성 속도 (t/s, 실제 답변 출력 속도)
메인보드 슬롯
71.8
AI BOX (썬더볼트)
70.7
손실 프롬프트 -2.4% · 생성 -1.5%
과부하 조건
컨텍스트 131K · VRAM 점유 94% · VRAM을 한계까지 채운 상황
📥 프롬프트 처리 속도 (t/s, 높을수록 빠름)
메인보드 슬롯
1,527
AI BOX (썬더볼트)
1,465
📤 토큰 생성 속도 (t/s, 실제 답변 출력 속도)
메인보드 슬롯
71.8
AI BOX (썬더볼트)
70.2
손실 프롬프트 -4.0% · 생성 -2.2%
⚡ 결론 — 과부하 조건에서도 성능 손실은 4% 이내, 실제 체감 차이는 사실상 없다고 봐도 됩니다.
컨텍스트 32K에서는 성능 차이가 약 2%에 그쳤고, 131K로 길어지자 약 4%로 벌어졌습니다. 프롬프트 처리는 입력이 길수록 차이가 조금씩 커졌지만, 토큰 생성 속도는 두 조건 모두 약 2% 수준이었습니다.
측정 조건에서는 썬더볼트 연결로 인한 손실이 최대 4% 정도였습니다. 앞에서 확인한 것처럼 여러 장의 GPU를 연결하는 목적이 단순히 속도를 높이는 데 있는 것은 아니지만, 적어도 LLM 추론에서는 외장 연결이라는 이유만으로 크게 느려지는 수준은 아니었습니다.
카드마다 다른 모델을 동시에
지금까지는 하나의 모델을 여러 장의 그래픽카드에 나눠 담았습니다. 하지만 그래픽카드가 네 장이라면 각각 다른 모델을 맡기는 것도 가능합니다. 슬롯에 연결한 두 장과 AI BOX 두 대에 서로 다른 모델을 하나씩 올려 네 가지 작업을 동시에 실행해봤습니다.
■카드마다 다른 모델을 동시에
4장 동시 구동 · 웹 UI 간이 측정 · 작업별 입력·출력 길이 상이 · Unsloth GGUF · llama.cpp b11029
GPU 0 · 메인보드 슬롯
Gemma 4 31B
범용 대화
65.8 t/s
GPU 1 · 메인보드 슬롯
Qwen3-Coder 30B
코딩
321.5 t/s
GPU 2 · AI BOX
Gemma 4 31B
이미지 인식
67.1 t/s
GPU 3 · AI BOX
Qwen3.8 27B
장문 처리
77.3 t/s
⚡ 네 모델이 동시에 돌아가도 카드마다 단독 구동에 가까운 속도를 냅니다. 각 카드가 자기 모델만 맡아 서로 데이터를 주고받지 않기 때문입니다.
네 모델이 동시에 돌아가는데도 서로 발목을 잡지 않았습니다. 대화 모델은 65.8 t/s대로 혼자 돌릴 때(71.8 t/s)보다 조금 낮은 수준을 유지했고, 코딩 모델은 321.5 t/s로 가장 빨랐습니다. 각 카드가 자기 모델만 온전히 맡으니 카드끼리 데이터를 주고받을 일이 없고, 그만큼 썬더볼트 링크가 끼어들 여지도 줄어듭니다. 슬롯과 외장을 나눠 쓰는 구성으로도 네 가지 작업을 무리 없이 병행할 수 있습니다.
소비 전력 측정에 쓰인 장비: HPM-100 Wattman
4장을 모두 돌리면 전력은
카드 네 장을 한꺼번에 구동하면 전기는 얼마나 들까요. HPM-100 Wattman로 실측했습니다.
■4장 풀가동, 전력은 얼마나
네 카드에 서로 다른 모델을 올려 동시 구동 · 벽면 전력계 실측
전원은 세 갈래로 나뉜다
본체 파워와 AI BOX 두 대는 각각 다른 콘센트에서 전기를 뽑는다
본체 파워
슬롯 5090 ×2 + CPU 등
1,194.9W
AI BOX ① 자체 전원
591.2W
AI BOX ② 자체 전원
566.0W
본체 파워가 감당할 부하
1,194.9W
1,600W급 파워로 충분
벽 콘센트 전체 전기량
2,352.1W
회로 분리 권장 (220V·16A의 67%)
⚡ AI BOX는 자체 전원을 써서 본체 파워 부담이 늘지 않습니다. 다만 벽에서 나가는 전기 합은 2,352W라, 세 전원을 한 회로에 몰지 않는 편이 안전합니다.
먼저 짚어둘 점은 전원이 세 갈래로 나뉜다는 것입니다. 본체 파워는 슬롯에 꽂은 RTX 5090 두 장과 CPU 등 시스템 전체 전력을 감당하고, AI BOX 두 대는 각자 자체 전원을 씁니다. 본체 파워가 책임지는 부하는 약 1,195W로, 1,600W급 파워면 충분히 감당합니다. AI BOX를 붙였다고 기존 파워를 늘릴 필요는 없습니다.
다만 벽 콘센트에서 빠져나가는 전기의 총합은 다른 이야기입니다. 본체와 외장 두 대를 더하면 2,352W에 이릅니다. 220V 16A 회로 하나가 감당하는 양의 3분의 2를 차지하는 수준이라, 세 전원을 한 콘센트에 몰지 않는 편이 안전합니다.
같은 128GB를 다른 방법으로 산다면
그렇다면 128GB의 VRAM을 확보하는 데 비용은 얼마나 들까요. 가격은 2026년 9월 22일 컴퓨존 판매가 기준으로 비교했으며, 조사 시점에 세 제품 모두 품절 상태였습니다.
■VRAM 1GB당 가격
컴퓨존 판매가 기준 · 2026년 9월 조사 · 카드 단품 가격 ÷ VRAM 용량
GIGABYTE AORUS 지포스 RTX 5090 AI BOX D7 32GB 제이씨현
32GB · 8,337,000원 · 썬더볼트 외장
260,531원
GIGABYTE 지포스 RTX 5090 WINDFORCE OC D7 32GB 제이씨현
32GB · 8,699,000원 · 슬롯 장착
271,844원
RTX PRO 6000 Blackwell
96GB · 25,120,000원 · 워크스테이션 · ECC
261,667원
⚡ 외장 케이스와 전원부를 갖춘 AI BOX가 슬롯용 5090보다 GB당 약 4% 저렴합니다. 다만, 시장 상황에 따라 가격은 변동 될 수 있으니 참고용으로만 확인해주세요.
RTX 5090 AI BOX는 32GB VRAM을 기준으로 봤을 때 RTX 5090 그래픽카드보다 GB당 가격이 약 4% 저렴했습니다. 외장 케이스와 전원부가 함께 구성된 제품이라는 점을 감안하면 추가 비용이 붙지 않은 셈입니다.
다른 선택지로는 96GB VRAM을 제공하는 RTX PRO 6000이 있습니다. GB당 가격은 AI BOX와 비슷한 수준이지만, 한 장으로 확보할 수 있는 VRAM이 96GB라는 한계가 있습니다. 이번 테스트처럼 128GB가 필요한 모델까지 고려하면 단순히 GB당 가격만으로 비교하기는 어렵습니다.
이미 RTX 5090 두 장을 사용하고 있다면 이야기가 달라집니다. 메인보드와 케이스를 바꾸지 않고 AI BOX 두 대를 추가하는 것만으로 64GB에서 128GB로 늘릴 수 있기 때문입니다. 결국 이 구성의 비용은 새로운 시스템을 처음부터 만드는 가격이라기보다, 기존 시스템에서 부족한 VRAM을 어디까지 확장할 것인가라는 관점에서 보는 편이 맞습니다.
마치며
■ 연결, 걱정보다 간단했다
솔직히 처음에는 네 장이 다 잡힐지부터 자신이 없었습니다. 제조사 스펙에도 슬롯에 카드를 꽂은 만큼 쓸 수 있는 썬더볼트 장치가 줄어들 수 있다는 단서가 붙어 있었으니까요. 막상 케이블 두 가닥을 꽂고 부팅하니 RTX 5090 네 장이 나란히 잡혔습니다. 외장 박스 한 대가 이유 없이 느려져 애를 먹기도 했는데, 케이블을 다시 꽂는 것만으로 해결됐습니다.
■ 카드를 늘린다고 빨라지진 않는다
카드를 늘리면 당연히 빨라질 줄 알았는데 답변 속도는 오히려 조금씩 줄었습니다. 한 모델을 여러 장에 나눠 담으면 카드끼리 주고받는 시간이 쌓이기 때문입니다. 반면 걱정했던 썬더볼트 손실은 슬롯 대비 최대 4%에 그쳤고, 카드마다 다른 모델을 올리자 네 장이 각자 제 몫을 해냈습니다. 여러 장을 붙이는 이유가 속도가 아니라 용량이라는 걸 숫자로 확인했습니다.
■ 177B는 VRAM 안에, 그 이상은 시스템 메모리로
96GB부터 1,770억 파라미터 모델이 VRAM에 온전히 올라갔고, MoE 구조 덕에 300억급 모델보다 빠르게 답을 내놓았습니다. 가장 오래 기억에 남는 건 2,840억 파라미터의 DeepSeek V4-Flash가 처음 답을 써 내려가던 순간입니다. 128GB로도 다 담기지 않아 시스템 메모리까지 빌려 쓰느라 속도는 크게 떨어졌지만, 서버에서나 돌릴 법한 2,840억 파라미터 모델이 책상 위 데스크톱에서 작동한다는 사실은 꽤 인상적이었습니다.
■ 본체 파워는 그대로, 콘센트는 따로
AI BOX가 자체 전원을 쓰니 본체 쪽 부하는 약 1,195W에 머물렀고, 외장을 붙였다고 파워를 키울 필요는 없었습니다. 다만 네 장을 한꺼번에 굴리면 벽 콘센트에서 2,300W 넘게 빠져나가 회로를 나눠야 합니다. 가격은 GB당 기준으로 AI BOX가 슬롯용 5090보다 약 4% 저렴했는데, 그보다는 이미 5090 두 장을 쓰는 사람이 보드와 케이스를 그대로 둔 채 VRAM을 두 배로 늘릴 수 있다는 점이 더 크게 다가옵니다.
돌아보면 이 구성이 모든 사용자에게 맞는 답은 아닙니다. 썬더볼트 5 포트가 두 개 달린 메인보드가 필요하고, AI BOX 두 대를 추가하는 비용도 만만치 않습니다. 그럼에도 RTX 5090 두 장을 장착한 뒤 더 이상 확장할 방법이 없다고 생각했던 입장에서는, 케이블을 연결하는 것만으로 그 한계를 넘어설 수 있다는 사실을 확인한 것만으로도 충분히 시도해 볼 만한 구성이었습니다.
퀘이사존 저작물은 크리에이티브 커먼즈 저작자표시-비영리-변경금지 4.0 국제 라이선스에 따라 이용할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 퀘이사존 기획/리포트의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기