RTX 4090에서 125B 모델을 100 tok/s로 구동하는 것? HN의 과장된 부분
요약
본 기사는 RTX 4090과 같은 게이밍 GPU 환경에서 대규모 MoE 모델(125B)을 고속으로 구동하는 기술적 가능성을 분석합니다. 핵심은 전체 매개변수를 VRAM에 담지 않고, 희소성(Sparsity), 시스템 RAM 스트리밍, 그리고 조회 기반의 n-gram 처리를 결합한 아키텍처 최적화 덕분입니다.
핵심 포인트
- MoE 구조를 활용하여 토큰당 활성화되는 매개변수를 6B로 줄임.
- n-gram 테이블을 NVMe에 저장하고 스트리밍 방식으로 처리 속도를 유지함.
- 다중 토큰 예측 및 추측 디코딩(speculative decoding)이 고속 구동의 핵심 요소임.
- 실제 성능은 작업 부하(코드 vs. 산문)와 하드웨어 구성에 따라 달라짐.
Strata라는 저장소(repo)가 '사용자 하드웨어(RTX 4090)에서 Qwen 3.8 Flash Next (125B)를 100 tok/s로 실행하기'라는 제목으로 Hacker News에서 788점을 기록했습니다.
125B 매개변수 모델을 게이밍 GPU에서 초당 100 토큰 속도로 구동한다는 것입니다.
실제일까요? 네. 하지만 제목이 암시하는 것과 같을까요? 아닙니다. 물리학적 원리와 마케팅적 과장을 분리해 보겠습니다.
이것이 가능한 이유
24GB 카드로는 125B 모델 전체를 담을 수 없습니다. 이 점은 변하지 않았습니다. 바뀐 것은 모델 자체의 아키텍처입니다.
Qwen3.8-Flash-Next는 희소 MoE(Sparse Mixture of Experts) 구조를 가지고 있습니다:
- 총 약 180B 매개변수 (125B 메인 모델 + 약 51B n-gram 임베딩 + 약 4B MTP 헤드)
- 토큰당 활성화되는 매개변수는 약 6B
- 512개의 전문가(experts), 상위 10개 라우팅 및 공유된 전문가 1개
- 48개 레이어: 36 Gated DeltaNet + 12 sparse attention
- 262k 네이티브 컨텍스트
사용하는 매개변수는 토큰당 약 6B에 불과합니다. 따라서 핵심 원리는 간단합니다. 가장 중요한 부분(attention, 공유 가중치, 가장 많이 사용되는 전문가)은 VRAM에 유지하고, 나머지는 시스템 RAM에 보관한 뒤, 필요한 것을 PCIe를 통해 스트리밍하는 것입니다.
이 수치를 가능하게 하는 두 가지 추가 요소가 있습니다:
- n-gram 테이블은 행렬 곱셈(matmul)이 아닌 조회(lookup) 방식입니다. 전체 매개변수의 약 3분의 1을 차지하며, 희소 행 읽기(sparse row reads)를 수행합니다. 이는 NVMe에 저장되어도 처리량(throughput)을 떨어뜨리지 않는다는 의미입니다. 한 배포에서는 47.7 GiB 크기의 양자화된 테이블을 SSD에 보관하고 최대 속도로 디코딩했습니다.
- 다중 토큰 예측 + 추측 디코딩(speculative decoding). Strata는 작은 헤드를 사용하여 토큰 초안을 작성한 후 한 번의 패스로 이를 검증합니다. 수용률은 작업 부하에 따라 크게 달라지는데, 산문(prose)에서는 약 0.59, 코드(code)에서는 0.88, 구조화된 출력(structured output)에서는 0.93 정도입니다.
마지막 점이 중요합니다. Strix Halo 장치에서 동일한 모델은 산문 처리 시 약 22 tok/s에서 코드 처리 시 82 tok/s로 속도가 빨라졌습니다. '100 tok/s'는 코드 및 구조화된 출력에 대한 수치입니다. 사용자가 작성하는 대화체 산문(chatty prose)은 더 느릴 것입니다.
별표: RAM
제목이 건너뛴 부분입니다. Strata 자체의 요구 사항은 다음과 같습니다:
별표: RAM
제목이 건너뛴 부분입니다. Strata 자체의 요구 사항은 다음과 같습니다:
| System RAM | 실행 가능한 모델 |
|---|---|
| 32 GB | "Coder" 변형 (전문가 중 절반 제거, 전체 SWE-bench Verified의 약 91%) |
| ... | |
| And the headline benchmark? 독립적인 4090 측정 레포가 DDR5 192 GB를 탑재한 Ryzen 7900에서, GPU 전력을 280W로 제한하여 실행했습니다. 결과는 다음과 같습니다: |
- 110.8 tok/s 텍스트 디코드 (IQ3_S, 낮은 추론)
- 비전 기능을 사용할 경우 97.65 tok/s
- 32K에서 콜드 프리필(cold prefill) 시 약 4,750 tok/s
- 30개 항목 중 28개 달성 (Q4_K_XL은 낮은 추론에서 30/30을 기록했지만, 추론 기능을 사용하면 27/30)
작가는 이 점을 명확히 밝힙니다: 모든 전문가(experts)와 n-gram 테이블은 RAM에 상주해야 하며, 양질의 결과는 단일 시드(single-seed) 기준입니다 (±1~2건의 편차 발생 가능). 또한 활성화되는 요청은 오직 하나만 최적화됩니다.
따라서 솔직한 핵심 내용은 다음과 같습니다: 4090 한 장과 워크스테이션급 RAM을 갖춘 125B급 모델이 약 100 tok/s로 구동된다는 것. 여전히 인상적이지만, '2022년식 게이밍 PC' 수준은 아닙니다.
실제 실행 명령어의 모습
마법 같은 것은 없습니다. 이것은 여러 조절 장치(knobs)를 쌓아 올린 것입니다:
--pack /work/packs/iq3s \
--expert-profile /opt/strata/data/expert-profile.bin \
--expert-cache auto \
...
이것을 해석하면 다음과 같습니다: 어떤 전문가가 활성화되는지 프로파일링하고, 이를 GPU에 캐시하며, 4 토큰을 미리 추측(speculate)하고, KV를 int8로 양자화하며, PCIe 대역폭을 포화시키지 않습니다 (--pcie-frac 0.35).
일반 사용자들을 위해 Strata는 설치 프로그램(START-HERE.bat은 Windows용, ./setup.sh는 Linux용)을 제공합니다. 이 프로그램이 GPU와 RAM을 감지하고, 양자화 방식을 선택하며, 약 70GB를 다운로드하여 OpenAI와 호환되는 API를 제공합니다:
# 모든 OpenAI 클라이언트가 여기에 연결하면 됩니다
base_url = "http://127.0.0.1:8080/v1"
# Anthropic 스타일 엔드포인트도 가능
...
만약 llama.cpp를 사용하여 직접 구축하려면, 2026년 8월 27일 이후의 빌드가 필요합니다. 이전 버전은 unknown model architecture: 'qwen4exp' 오류와 함께 작동하지 않습니다.
HN 스레드에서 정확했던 부분
댓글들은 좋은 현실 점검이 됩니다:
- "벤치마크가 없으면, 숫자를 내놓을 때까지는 알 수 없을 겁니다." 공평한 지적이며, 4090 리포지토리가 이를 부분적으로 답변합니다.
- "2비트 양자화(quant)는 기껏해야 전체 모델의 약 80%만 얻을 수 있습니다... 실제로는 더 나쁩니다." 출력 품질에 신경 쓴다면 Q2_0 대신 IQ3_S를 사용하세요. Q2_0이 가장 높은 tok/s (Strata 표 기준 RTX 5070에서 94)를 제공하지만, IQ3_S (거기서 53 tok/s)가 합리적인 기본값입니다.
- 한 사용자는 IQ3_XXS가 더 빠른 속도에서 27B 변형 모델을 능가하고, 자체 작업에서는 최첨단(frontier) 모델과 "견줄 만하다(neck and neck)"고 보고했습니다. 이것은 일화(Anecdote)이며 벤치마크가 아닙니다. 그렇게 취급하세요.
- 비용 문제: 4090의 출시 가격이 $1,600입니다. "소비자 하드웨어(Consumer hardware)"가 많은 작업을 수행하고 있습니다.
결정하기 전에 알아야 할 수치들
공유된 벤치마크에서 Flash-Next는 모든 9개 테스트에서 Qwen3.8-27B를 능가하며 평균 +4.19점을 기록했고, 에이전트 작업(agentic work)에서 가장 큰 격차를 보였습니다: DeepSWE 42.2 → 58.7. 이것이 정말로 신경 써야 할 이유입니다. 27B 밀집 모델(dense model)은 쉽게 들어맞으며; 핵심은 _에이전트 코딩 품질_을 로컬에서 얻는 것입니다.
또한: 라이선스는 Apache 2.0이 아닌 Qwen Community License 1.0입니다. 셀프 호스팅 및 상업적 사용은 괜찮지만, 대규모 제품(MAU 1억 명 이상 또는 매출 $20M 이상)은 모델 이름을 표시해야 하며, 모델-서비스로서의 제공(model-as-a-service)에는 별도의 라이선스가 필요합니다. 비즈니스를 구축하기 전에 반드시 읽어보세요.
시도하기 전 알아둘 점들
- 첫 시작 시 35
55 GB가 RAM에 로드되면서 기기가 13분간 멈춥니다(freezes). - Strata의 자체 12GB 카드 수치로 약 30K 토큰 프롬프트는 첫 번째 토큰을 생성하는 데 약 1분이 걸립니다.
- 병렬 요청은 기본적으로 꺼져 있습니다. `
만약 64GB 이상의 RAM과 괜찮은 GPU를 가지고 있다면, MTP 수용도가 높고 속도가 실제인 코드 작업에는 IQ3_S 팩을 사용해 보세요. 만약 RAM이 16GB라면, 아직 당신에게는 적합하지 않으며 아무리 많은 HN 포인트도 상황을 바꿀 수는 없습니다.
당신의 워크로드에 맞춰 벤치마킹 해보세요. 산문(Prose), 코드, 그리고 구조화된 출력은 동일한 모델에서 세 가지 매우 다른 tok/s 수치를 제공할 것입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기