Qwen3.8-Max 정식 출시(GA): Alibaba의 2.4T 모델 개발자 가이드
요약
Alibaba가 2.4조 개의 파라미터를 보유한 MoE 모델 Qwen3.8-Max를 정식 출시했습니다. 1M 컨텍스트 윈도우와 멀티모달 입력을 지원하며, 효율적인 연산을 위해 토큰당 약 95B의 활성 파라미터를 사용합니다.
핵심 포인트
- 2.4T 파라미터 규모의 Sparse MoE 모델 출시
- 토큰당 95B 활성 파라미터로 연산 효율성 확보
- 1M 토큰 컨텍스트 윈도우 및 멀티모달 지원
- OpenAI 호환 API 제공 및 오픈 웨이트 공개 예정
Alibaba는 2026년 8월 3일 Qwen3.8-Max를 정식 출시(GA, Generally Available)했습니다.
이 글은 개발자들을 위한 실질적인 요약입니다. 이 모델이 무엇인지, 비용은 얼마인지, 어떻게 호출하는지, 그리고 어떤 주장들을 주의해서 받아들여야 하는지를 다룹니다.
한 줄 요약
Qwen3.8-Max는 2.4조(trillion) 개의 파라미터를 가진 Mixture-of-Experts (MoE) 모델로, 1M-토큰 컨텍스트 윈도우(context window), 네이티브 텍스트/이미지/비디오 입력, OpenAI 호환 API를 지원하며, 가격은 백만 토큰당 입력(in) $2 / 출력(out) $6입니다. 다음 주에 오픈 웨이트(Open weights) 공개가 약속되었습니다.
먼저, 명칭의 혼란에 대하여
버전 번호 때문에 사람들이 혼란을 겪을 수 있으니, 이를 정리해 보겠습니다:
- Qwen3는 여러분이 아마 사용해 보았을 오픈 웨이트 (open-weight) 모델 제품군입니다 (Qwen3-32B, Qwen3-235B-A22B 등).
- Qwen3.5 / 3.6 / 3.7 / 3.8은 Qwen3의 소수점 버전이 아니라, _연속적인 플래그십 세대(successive flagship generations)_입니다.
- **"Max"**는 각 세대의 최상위 티어입니다.
따라서 Qwen3.8-Max는 "Qwen 3의 8번째 버전"이 아닙니다. 이는 2026년 5월의 Qwen3.7-Max를 잇는 최신 플래그십 모델입니다. Qwen은 이를 현재까지 가장 유능한 모델이자, Max 규모의 첫 번째 오픈 웨이트 모델이라고 설명합니다.
또한 Qwen3.8-Max-Preview (7월 19일)와 현재의 Qwen3.8-Max (8월 3일, GA)가 있다는 점에 유의하세요. 만약 7월에 작성된 블로그 포스트를 읽고 있다면, 그것은 프리뷰에 관한 내용이며, 그 포스트에서 "아직 공개되지 않음"이라고 명시된 목록의 절반은 그 이후에 답변되었습니다.
중요한 사양(Specs)
| 사양 | 값 |
|---|---|
| 총 파라미터 수 | 2.4조 (sparse MoE) |
| ... |
왜 "95B 활성(active)" 수치가 중요한가
이 부분은 제대로 이해할 가치가 있습니다. 왜냐하면 "2.4조 개의 파라미터"라는 말 자체는 그 자체만으로는 거의 의미가 없기 때문입니다.
Sparse Mixture-of-Experts 모델은 하나의 거대한 네트워크가 아닙니다. 각 레이어(layer)는 많은 전문가 서브 네트워크("experts")를 보유하고 있으며, 라우터(router)가 각 토큰에 대해 소수의 전문가를 선택합니다. 나머지 전문가들은 해당 토큰에 대해 유휴 상태로 머뭅니다.
Qwen의 자체 소형 모델들은 명칭을 통해 이 패턴을 명확히 보여줍니다: Qwen3-235B-A22B는 총 235B의 파라미터를 보유하지만 토큰당 22B를 활성화하며, Qwen3-30B-A3B는 약 3B를 활성화합니다.
따라서:
- 전체 파라미터 (Total parameters) ≈ 모델이 얼마나 '아는지' (그리고 이를 호스팅하는 데 얼마나 많은 메모리가 필요한지)
- 활성 파라미터 (Active parameters) ≈ 각 토큰 생성 시 실제로 소요되는 연산량 (compute)
전체 2.4T / 활성 ~95B 기준으로, 토큰당 네트워크의 약 4%가 작동합니다. 이것이 Alibaba가 파괴적인 가격 대신 입력 1M 토큰당 2달러라는 가격에 판매할 수 있는 이유입니다.
한 가지 솔직한 참고 사항: 이 수치에는 작은 주의사항(*)이 필요합니다. MarkTechPost의 출시 보도에서는 Alibaba가 활성 파라미터 수를 공개하지 않았다고 언급했으나, 벤치마크 트래커들에 따르면 Qwen의 자체 8월 3일 출시 게시물에는 전체 2.4T, 활성 95B로 기재되어 있습니다. 다른 보도들은 Alibaba가 모델 카드 (model card)를 발행하여 확정하기 전까지는 이 수치를 확인된 사실보다는 보고된 수치로 취급할 것을 권고합니다. 따라서 이 수치는 대략적인 비용 직관을 얻는 용도로만 사용하고, 용량 계획 (capacity planning)을 세우는 데 사용하지 마십시오.
그리고 명확히 해두자면: 활성 파라미터가 95B라고 해서 95B 크기의 서버에서 이 모델을 서빙할 수 있다는 뜻은 아닙니다. 서빙 시스템은 여전히 전체 전문가 풀 (expert pool)에 대한 빠른 접근, 어텐션 상태 (attention state), 라우팅 메커니즘 (routing machinery), 멀티모달 구성 요소 및 런타임 버퍼 (runtime buffers)가 필요합니다. 전체 2.4T 체크포인트 (checkpoint)는 어딘가에 상주하고 있어야 합니다.
가격 책정, 그리고 청구 금액을 결정짓는 결정적인 비결
| 항목 | 1M 토큰당 가격 |
|---|---|
| 입력 (Input) | $2.00 |
| ... |
반드시 숙지해야 할 점은 다음과 같습니다: 캐시된 입력 (cached input)은 새로운 입력 (fresh input)보다 8배 저렴하며, 이는 프롬프트 길이보다 접두사 안정성 (prefix stability)이 비용을 더 크게 좌우한다는 것을 의미합니다.
이 한 문장은 이 모델을 위한 아키텍처를 설계하는 방식을 완전히 바꿔 놓아야 합니다. 구체적으로, 200K 토큰의 안정적인 접두사 (시스템 프롬프트, 도구 스키마, 코드베이스 컨텍스트)를 가진 에이전트 루프가 50턴 동안 실행되는 상황을 가정해 보겠습니다:
캐시 미사용: 50 × 0.2M × $2.00 = $20.00
명시적 캐시 사용: (0.2M × $2.50) + (50 × 0.2M × $0.17) = $2.20
단순히 접두사의 바이트를 안정적으로 유지하는 것만으로도 대략 9배의 차이가 발생합니다. 실질적인 시사점은 다음과 같습니다:
- 모든 정적(static) 정보는 프롬프트의 앞부분에 배치하고, 모든 가변(variable) 정보는 끝에 배치하세요.
- 시스템 프롬프트(system prompt)에 타임스탬프, 요청 ID(request ID) 또는 섞인 컨텍스트(shuffled context)를 주입하지 마세요.
- 요청마다 접두사(prefix)를 다시 구축하고 있다면, 아무 이유 없이 8배의 비용을 지불하고 있는 것입니다.
업계 표준과 비교해 보세요: Kimi K3는 100만 토큰당 입력 $3.00 / 출력 $15.00로 구동되므로, Qwen3.8-Max는 특히 출력 측면에서 이를 유의미하게 앞섭니다.
API 호출하기
통합 과정은 의도적으로 지루할 만큼 단순하며, 그것이 핵심입니다. 호스팅된 API는 OpenAI 및 DashScope와 호환되므로, 통합 시 베이스 URL(base-URL)과 모델 ID(model-ID)만 변경하면 됩니다. 또한 Anthropic 프로토콜도 지원하므로 Cursor, Cline, Codex, Claude Code와 같은 도구들이 기존 통합 방식을 통해 이 모델을 가리킬 수 있습니다.
다음은 DashScope SDK를 사용하여 모델 페이지에서 직접 가져온 멀티모달(multimodal) 예시입니다:
import os
import dashscope
...
이미 OpenAI SDK를 사용 중이라면, base_url을 Alibaba의 호환 모드 엔드포인트(endpoint)로 지정하고 모델 문자열을 qwen3.8-max로 변경하면 됩니다. 국제 배포 버전과 중국 국내 배포 버전 간에 차이가 있으므로, 추측하지 말고 docs.qwencloud.com에서 정확한 베이스 URL을 확인하세요.
두 개의 지역별 엔드포인트에 주의하세요. 가용성은 국제 배포(qwencloud.com)와 중국 국내 배포(platform.qianwenai.com)로 나뉘어 있으며, 각각 별도의 등록과 결제가 필요합니다. API 키는 서로 호환되지 않습니다.
이미 제3자 게이트웨이에도 탑재되어 있습니다. Vercel의 AI Gateway는 8월 2일에 추가 마진 없이 제공자 가격 그대로 alibaba/qwen3.8-max를 추가했습니다.
지원되는 기능
함수 호출(Function calling), 구조화된 출력(structured outputs), 배치(batches), 접두사 완성(prefix completion) 및 미세 조정(fine-tuning)이 모두 지원됩니다. 응답 API(Responses API)에는 다섯 가지 내장 도구가 포함되어 있습니다: code_interpreter, web_search, web_extractor, t2i_search 및 i2i_search.
직접 도구를 만들기 전에 내장 도구들을 살펴보는 것이 좋습니다. 만약 현재 커스텀 웹 검색 도구 래퍼(wrapper)를 유지 관리하고 있다면, 이제는 서버 측 플래그(flag) 하나로 해결할 수 있습니다.
벤치마크 (Benchmarks): 정직한 읽기
7월 프리뷰와 달리, 정식 출시(GA)와 함께 실제 수치들이 공개되었습니다. Alibaba는 정식 출시와 함께 벤치마크 표를 발표했으며, Terminal-Bench 2.1에서 86.6, SWE-bench Pro에서 67.7, GPQA Diamond에서 92.6을 기록했습니다. 일반적인 추론(general reasoning)보다는 멀티모달(multimodal) 및 에이전트(agentic) 카테고리에서 가장 강력한 성능 향상을 보였습니다.
경쟁 구도를 살펴보면 다음과 같습니다:
| 벤치마크 (Benchmark) | Qwen3.8-Max | Claude Fable 5 | 비고 (Notes) |
|---|---|---|---|
| Terminal-Bench 2.1 | 86.6 | 84.6 | GPT-5.6 Sol (max)가 88.8로 선두 |
| ... |
또한 OSWorld-Verified 86.1, Parametric CAD Bench 91.5, OmniDocBench 1.5 92.1을 포함하여 대부분의 비전(vision) 항목에서 1위를 차지했습니다. 이전 모델과 비교했을 때의 도약은 매우 큽니다. DeepSWE 1.1은 21.6에서 56.6으로, FrontierSWE는 40.7에서 73.5로, JobBench는 31.3에서 53.4로 상승했습니다.
MarkTechPost가 지적한, 공정한 해석을 위해 반드시 고려해야 할 두 가지 주의 사항이 있습니다. 첫째, 멀티모달(multimodal) 표는 Qwen3.7-Max가 아닌 Qwen3.7-Plus를 기준으로 벤치마크를 수행하여 세대 간 차이(generational delta)가 실제보다 부풀려졌습니다. 둘째, Alibaba 자체의 강화학습 (RL) 스케일링 커브(scaling curve)는 약 4,000개의 훈련 환경 근처인 0.725에서 정점을 찍은 후, 0.719와 0.689로 하락합니다.
오픈 웨이트 (Open weights): 세부 사항 확인
Alibaba는 다음 주에 오픈 웨이트 (open weights)와 함께 두 번째 체크포인트인 Qwen3.8-27B를 출시할 것이라고 확인했습니다. 출시 예정일은 8월 10일 주간이며, Alibaba Cloud Model Studio를 통해 제공될 예정입니다. 이는 올해 초 여러 플래그십 모델을 폐쇄형(proprietary)으로 유지해 온 Alibaba가 다시 최상위 모델을 오픈 소스로 공개하기 시작했음을 의미합니다.
여전히 부족한 점
부족한 부분에 대해 솔직하게 말씀드리자면 다음과 같습니다:
- 모델 카드 (model card) 부재. 정식 출시(GA) 단계에서도 여전히 공식적인 훈련 및 안전 모델 카드가 제공되지 않았습니다. 훈련 데이터 공개도, 안전 평가 방법론(safety evaluation methodology)도 없습니다.
- 공개된 라이선스 없음. 웨이트(weights)가 출시되기 전까지는 상업적 이용 약관에 대해 검토할 수 있는 내용이 없습니다.
- 활성 파라미터 수(Active parameter count)는 보고되었으나, 사양서(spec sheet)를 통해 공식적으로 확인되지는 않았습니다.
- 아직 독립적인 Artificial Analysis 점수가 없습니다.
사용해야 할까요?
다음과 같은 경우라면 지금 바로 사용해 보세요: 멀티모달 (multimodal) 작업(문서, 비디오 인덱싱, 스크린샷, UI 자동화)을 수행 중이거나, 서구권의 프런티어 (frontier) 모델 가격의 극히 일부만으로 긴 컨텍스트 (long-context) 에이전트 실행을 원하는 경우, 또는 기존의 OpenAI/Anthropic 프로토콜 설정을 갖추고 있어 베이스 URL (base-URL) 변경과 오후 시간 정도의 투자만으로 테스트가 가능한 경우입니다.
참고 문헌:
- Qwen3.8-Max 모델 페이지 (QwenCloud) — 공식 사양, 가격, 속도 제한 (rate limits)
이 모델을 이미 프로덕션 (production) 환경에서 실행 중이신가요? Alibaba가 처리량 (throughput) 수치를 공개하지 않았기 때문에, 실제 지연 시간 (latency)과 초당 토큰 수 (tokens-per-second) 수치가 궁금합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기