Qwen 3.8을 로컬에서 실행하는 방법: 2.4T Max Math, 오픈 웨이트(Open Weight) 27B, 그리고 현재 실행 가능한
요약
Alibaba가 2.4T 파라미터 규모의 MoE 모델인 Qwen 3.8 Max를 출시했습니다. 100만 토큰 컨텍스트와 멀티모달 기능을 지원하며, 다음 주에 로컬 실행이 가능한 오픈 웨이트 27B 모델이 공개될 예정입니다.
핵심 포인트
- Qwen 3.8 Max는 2.4T 파라미터 MoE 구조로 높은 성능 기록
- 로컬 환경을 위한 오픈 웨이트 27B 모델 출시 예정
- Max 모델은 막대한 VRAM 요구로 인해 데이터 센터 중심 서비스 적합
- 27B 모델은 양자화를 통해 소비자용 하드웨어에서 실행 가능 기대
Alibaba는 오늘(8월 3일) Qwen 3.8 Max를 일반적으로 사용할 수 있도록 출시했습니다. 이 모델은 Mixture of Experts (MoE) 방식의 약 2.4조(trillion) 개의 파라미터를 보유하며, 100만 토큰의 컨텍스트 윈도우 (context window), 이미지 및 비디오 입력을 지원합니다. 또한 GPQA Diamond에서 92.6, Terminal-Bench 2.1에서 86.6과 같은 런칭 점수를 기록했습니다. 이 포스트에서 중요한 부분은 다음과 같습니다. 오픈 웨이트 (open weight) 체크포인트가 다음 주에 제공될 예정이며, 여기에는 소비자용 크기인 Qwen 3.8 27B가 포함된다는 점입니다. 자신의 하드웨어에서 Qwen 3.8을 구동하고자 하는 분들을 위한 실질적인 상황을 정리해 드립니다.
모델의 형태가 모든 것을 결정합니다
MoE 모델은 하드웨어 문제를 두 가지로 나눕니다. 전체 파라미터 수(2.4T)는 메모리 비용을 결정합니다. 모든 전문가(expert)는 어딘가에 상주해야 하기 때문입니다. 활성 파라미터(Active parameters, 실행 시 약 95B)는 속도를 결정합니다. 이것이 Max 모델이 데이터 센터에서는 저렴하게 서비스될 수 있는 이유이자, 여러분의 데스크탑 타워에는 절대 들어갈 수 없는 이유입니다. 다음 토큰이 어떤 전문가를 활성화할지 알 수 없기 때문에 2.4T 파라미터 전체가 메모리에 올라가 있어야 합니다.
Max 모델의 수치
- FP8 (네이티브 서빙 정밀도): 약 2.4 TB의 가중치 (weights).
- Q4 (로컬 표준): 약 1.2 TB.
- 극단적인 2-bit 양자화 (quant): 약 600 GB, 실제 품질 저하 발생.
소비자가 2026년에 구매할 수 있는 가장 큰 단일 기기는 512 GB의 통합 메모리 (unified memory)를 탑재하고 있는데, 이는 100만 토큰 컨텍스트를 위한 KV 캐시 (KV cache)를 단 1바이트도 할당하기 전에 이미 Q4 가중치의 절반에도 미치지 못하는 수준입니다. 가중치가 공개된 후 몇 주 안에 누군가는 초당 한 자릿수 토큰을 보여주기 위해 Mac Studio들을 체인으로 연결할 것입니다. 멋진 영상은 되겠지만, 일상적인 용도로 쓰기에는 좋지 않을 것입니다.
27B가 실제 로컬의 핵심입니다
이것이 이번 출시가 Kimi K3나 DeepSeek V4 Pro와 다른 점입니다. 동일한 출시 과정에 오픈 웨이트 27B가 포함되어 있다는 것입니다. Qwen 3.6 27B의 전례를 바탕으로 예측해 보면:
| VRAM | 양자화 클래스 (Quant class) | 이전 모델 크기 (Precedent size) |
|---|---|---|
| 8 GB | 2 bit (UD-IQ2 클래스) | 8.7 GB, 품질 저하 |
| ... |
오픈 웨이트(Open weights)로 출시되는 Qwen 모델의 커뮤니티 GGUF 버전은 보통 웨이트 공개 후 며칠 이내에 등장합니다. 만약 27B 모델이 Max 모델의 에이전트적 이점(Agentic gains)을 일부라도 물려받는다면(FrontierSWE 점수가 이번 세대에서 40.7에서 73.5로 급등함), 해당 체급에서 거의 즉시 기본 로컬 모델로 자리 잡게 될 것입니다. 그리고 웨이트가 공개된다는 것은 파생 모델이 나온다는 것을 의미합니다. 모든 오픈 Qwen 세대는 몇 주 이내에 Abliterated(거부 메커니즘 제거) 및 Heretic(이단적/변형된) 빌드들을 받아왔습니다.
다음 주가 아닌, 오늘 실행할 수 있는 모델
모델이 출시되기 전까지, 실제로 실행할 수 있는 가장 최신 Qwen은 Qwen 3.6이며, 이는 진정으로 강력합니다. 27B Dense 모델은 8 GB VRAM 이상에서 실행되며, 35B MoE(활성 파라미터 3B)는 24 GB 환경에서 코딩용 선택지로 적합합니다. 현재의 llama.cpp 기반 스택을 사용하는 한 줄 명령어는 다음과 같습니다:
ollama pull qwen3.6:27b
타이핑보다 클릭을 선호한다면, 무료 오픈 소스 로컬 AI 스튜디오인 Locally Uncensored의 원클릭 모델 카탈로그에 Qwen 제품군이 포함되어 있습니다. 이 서비스는 다운로드 전 메모리를 확인하며 12개의 로컬 백엔드(Backend)와 통신합니다. 양자화 표(Quant tables)가 포함된 전체 설정 가이드는 여기에서 확인할 수 있습니다: How to Run Qwen 3.6 Locally, 그리고 Qwen 3.8에 대한 전체 하드웨어 계산 수치는 Can You Run Qwen 3.8 Locally?에 있습니다.
왜 굳이 집에서 실행해야 하는가
개인정보 보호(Privacy): 당신의 프롬프트는 절대 기기를 떠나지 않습니다. 비용(Cost): 오픈 웨이트는 사용량 기반의 요금제를 일회성 하드웨어 결정으로 바꿔줍니다. 제어권(Control): 오늘 벤치마크를 수행하는 모델이 내년에도 당신이 실행할 모델이 되며, 상위 단계에서의 조용한 교체(Silent upstream swaps)는 없습니다. 처음으로, 모두가 열광하는 프론티어(Frontier) 출시가 동일한 주간의 출시와 함께 당신이 실제로 소유할 수 있는 버전과 함께 찾아옵니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기