게이밍 노트북에서 180B 매개변수 MoE 모델 실행하기: VIDRAFT의 POCKET-Darwin-180B-GGUF
요약
VIDRAFT가 180B 매개변수 MoE 모델인 POCKET-Darwin-180B-GGUF를 출시했습니다. 이 모델은 4비트 양자화와 llama.cpp 기반 SSD 스트리밍을 결합하여, 고성능 서버 없이도 VRAM 8GB/RAM 32GB 게이밍 노트북 같은 일반 소비자 하드웨어에서 구동 가능합니다. 이는 온디바이스 및 에어갭 환경의 개발자들에게 큰 이점을 제공합니다.
핵심 포인트
- 180B MoE 모델을 소비자급 노트북에서 실행할 수 있게 함.
- MoE 구조와 4비트 양자화로 하드웨어 요구 사항을 대폭 절감.
- llama.cpp 기반 SSD 스트리밍으로 메모리 제약을 극복함.
- 온디바이스, 에어갭 환경의 개발 및 배포에 최적화됨.
⚠️ TL;DR:
VIDRAFT가 POCKET-Darwin-180B-GGUF를 출시했습니다. 이는 4비트 양자화된 GGUF 형식의 180B Mixture-of-Experts 모델로, VRAM 8GB 및 RAM 32GB를 갖춘 게이밍 노트북을 포함한 일반 소비자 하드웨어에서 실행할 수 있습니다. MoE 희소 활성화(sparse activation)와 llama.cpp 기반 SSD 스트리밍을 결합하여 추론 시 토큰당 약 3B 매개변수만 계산하므로, 전체 정밀도 서버 설정 대비 하드웨어 요구 사항을 약 250배 절감했습니다. 에어갭 환경 또는 온디바이스 배포를 개발하는 개발자들은 주목해야 합니다.
무엇인가요
POCKET-Darwin-180B-GGUF는 VIDRAFT의 Darwin-180B-RSI 기반 모델의 압축되고 소비자용으로 실행 가능한 버전입니다. 이 모델은 1800억 개의 매개변수를 가지며, Qwen3.8-Flash-Next를 기반으로 구축되었습니다. 원래의 Darwin-180B-RSI는 BF16 정밀도에서 360 GB에 달하며, 일반적으로 서비스를 제공하려면 다중 GPU 서버가 필요합니다.
POCKET 변형 모델은 이 문제를 직접적으로 해결했습니다:
- 양자화: 전체 모델에 4비트 가중치 양자화 적용
- 결과 크기: GGUF 형식의 4개 파일에 걸쳐 약 111 GB
- 배포: Hugging Face와 ModelScope(중국)에 동시에 출시
- 대상 사용 사례: 클라우드 계정이나 전용 GPU 서버 없이 온프레미스, 에어갭 또는 로컬 추론
이 모델명은 VIDRAFT가 제시한 제품 전략을 따릅니다. 능력(capability)을 위한 RSI (Recursive Self-Improvement), 배포 용이성(deployability)을 위한 POCKET입니다.
작동 방식
핵심 통찰력은 Darwin-180B가 처음부터 Mixture-of-Experts (MoE) 모델로 설계되었다는 것입니다. 이는 공격적인 압축을 수행하면서도 성능 저하 없이 가능하게 만듭니다.
개념적 스택은 다음과 같습니다:
-
희소 MoE 아키텍처 (Sparse MoE architecture): 전체 모델은 512개의 전문가(expert) 서브 네트워크를 포함합니다. 각 토큰마다 10개의 전문가만 활성화되므로, 토큰당 유효 컴퓨팅량은 전체 180B가 아닌 대략 ~3B의 활성 매개변수에 해당합니다. MoE에서는 총 매개변수 수와 활성 매개변수 수가 매우 다른 숫자이기 때문에, 여기서의 양자화(quantization)는 밀집 모델(dense model)에서 발생할 손실보다 적습니다.
-
4비트 양자화 (4-bit quantization): 모델 가중치(weights)를 BF16에서 4비트 정수 표현으로 변환합니다. 이로 인해 저장 공간 크기(storage footprint)가 360 GB에서 111 GB로 줄어듭니다. MoE 라우팅 구조는 유지되므로, 모델은 여전히 토큰당 512개 전문가 중 10개를 선택하지만, 양자화된 가중치를 사용합니다.
-
GGUF 형식 + llama.cpp SSD 스트리밍 (SSD streaming): 추론(inference) 시 전체 111 GB를 RAM에 로드하는 대신, 시스템은 llama.cpp가 SSD에서 필요한 가중치를 온디맨드로 스트리밍할 수 있는 기능을 사용합니다. 현재 토큰에 필요한 전문가 가중치만 메모리에 상주(resident)하면 됩니다. 이것이 바로 8 GB VRAM + 32 GB RAM 노트북 구성이 실현 가능한 이유입니다. 즉, SSD가 메모리 계층 구조(memory hierarchy)의 확장 역할을 하는 것입니다.
이 세 가지 기술—희소 활성화 (MoE), 공격적인 양자화, 그리고 온디맨드 페이지 가중치 스트리밍—의 조합 덕분에 총 매개변수가 180B인 모델을 일반적으로 7B 밀집 모델이 최대 성능에 도달하는 환경에서도 실행할 수 있게 된 것입니다.
벤치마크 및 결과 (Benchmarks & results)
VIDRAFT는 자체 테스트를 통해 다음과 같은 수치를 발표했습니다 (self-reported):
| 하드웨어 구성 | 추론 속도 | 참고 사항 |
|---|---|---|
| 서버 CPU 전용, 1× CPU (16 스레드) | 18.4 – 21.0 토큰/초 | 메모리 사용량: 78.8 GB |
| ... | ||
| 양자화 후 정확도 유지율 (MMLU-Pro, 2,000 문제, 일치 항목): |
- 양자화 전 (Pre-quantization): 87.65%
- 양자화 후 (Post-quantization): 87.65%
그들의 평가 방법론에 따라 MMLU-Pro에서 측정 가능한 정확도 저하가 관찰되지 않았습니다. 이는 일치하는 질문 세트에 대한 자체 보고 결과이므로, 독립적인 재현(replication)은 항상 권장됩니다.
사용 방법
해당 모델은 GGUF 형식으로 Hugging Face와 ModelScope에서 공개적으로 이용 가능합니다. 최신 버전의 llama.cpp와 약 111 GB의 여유 저장 공간이 필요합니다.
Hugging Face CLI를 통해 다운로드:
pip install huggingface_hub
huggingface-cli download VIDRAFT/POCKET-Darwin-180B-GGUF --local-dir ./pocket-darwin-180b
다운로드가 완료되면 llama.cpp를 사용하여 실행합니다 (일반적인 호출 방식이며, 정확한 권장 플래그는 모델 카드(model card)를 확인하세요):
./llama-cli -m ./pocket-darwin-180b/<모델 파일>.gguf \
--n-gpu-layers <N> \
-p "여기에 프롬프트를 입력하세요"
순수 CPU 추론을 위해서는 --n-gpu-layers 0으로 설정하고, GPU로 레이어를 오프로드하려면 양의 정수를 사용합니다. 낮은 RAM 하드웨어에서의 SSD 스트리밍에는 llama.cpp 문서의 mmap 및 컨텍스트 관리(context management) 부분을 참조하세요.
정확한 파일 이름, 권장 컨텍스트 길이, 채팅 템플릿은 Hugging Face의 모델 카드를 확인하십시오.
자주 묻는 질문 (FAQ)
질문: 왜 180B 모델이 토큰당 약 3B 매개변수 분량의 연산만 필요할까요?
답변: 이것은 Mixture-of-Experts(전문가 혼합)의 정의적인 속성입니다. 180B라는 수치는 모든 512개의 전문가 네트워크에 걸친 총 매개변수 예산을 의미합니다. 추론 시, 학습된 라우터(router)는 토큰당 이 512개 전문가 중 단지 10개만을 선택하므로, 토큰당 실제 부동 소수점 연산량은 대략 3B의 활성 매개변수에 해당합니다. 따라서 180B의 저장 비용을 지불하지만, 약 3B의 연산 비용만 지불하는 것입니다.
질문: 이 정도 크기의 모델에 4비트 양자화(quantization)가 품질에 의미 있는 손상을 주나요?
답변: VIDRAFT가 발표한 MMLU-Pro 평가에 따르면, 자체적으로 매칭된 2,000개 항목 테스트 세트에서 양자화 전후의 정확도는 동일했습니다. 하지만 양자화 효과는 작업 유형 및 프롬프트 스타일에 따라 다를 수 있으므로, 사용자의 특정 워크로드(workload)에 대한 벤치마킹을 항상 하는 것이 좋습니다.
Q: 기업의 에어 갭(air-gapped) 환경에 유용한가요?
A: 네, 그것이 주요 의도된 사용 사례로 보입니다. 이 모델은 클라우드 종속성 없이 llama.cpp를 통해 완전히 로컬에서 실행되므로, 데이터가 로컬 네트워크를 벗어날 수 없는 기업, 정부, 규제 산업 환경에 적합합니다.
Q: 기본 모델 이름에 언급된 RSI 구성 요소는 무엇인가요?
A: RSI는 Recursive Self-Improvement의 약자로, VIDRAFT가 모델 역량 향상을 위해 명시한 훈련 방법론입니다. POCKET 릴리스는 그 역량 위에 구축된 추론/배포 계층이며, RSI 프로세스는 Darwin-180B가 어떻게 훈련되었는지와 관련이 있을 뿐, POCKET-Darwin-180B-GGUF를 양자화하거나 서비스하는 방식과는 관련이 없습니다.
AI타임스(2026-10-06)에서 최초 보도됨 — 출처 기사.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기