
새로운 거대 모델이 나올 때마다 총 파라미터(Total Parameters) 수가 화제가 된다
요약
Alibaba가 공개한 Qwen3.8-Max 모델의 MoE 구조와 비용 효율적인 API 활용법을 다룹니다. 총 2.4조 개의 파라미터를 보유했으나 MoE 기술을 통해 실제로는 950억 개의 활성 파라미터만 사용하여 효율성을 높였습니다. 특히 프리픽스 캐싱을 통한 비용 절감과 OpenAI/Anthropic 호환 인터페이스를 통한 높은 개발 편의성을 강조합니다.
핵심 포인트
- MoE 구조를 통해 2.4조 파라미터 중 950억 개만 활성화하여 레이턴시 억제
- 프리픽스 캐싱(Prefix Caching) 활용 시 입력 비용을 최대 1/8 수준으로 절감 가능
- OpenAI 및 Anthropic 호환 인터페이스를 지원하여 기존 SDK와 높은 호환성 제공
- 최대 100만 토큰의 긴 문맥 길이를 지원하여 대규모 문서 및 영상 처리 가능
새로운 거대 모델이 나올 때마다 총 파라미터(Total Parameters) 수가 화제가 된다. 하지만 Qwen3.8-Max의 '2.4조'라는 숫자는 엔지니어가 실무에서 가장 먼저 신경 써야 할 지표가 아니다. 8월 3일 Alibaba가 일반 공개한 이 모델에서, 1토큰을 생성할 때 실제로 작동하는 것은 전체의 극히 일부이기 때문이다. 언론사들이 전하는 활성 파라미터(Active Parameters)는 950억이다. 총량 2.4조 중 계산에 관여하는 것은 약 4%에 불과하다.
이는 Mixture of Experts (MoE, 전문가 혼합)라는 구조 덕분이다. 모델 내부를 다수의 작은 '전문가(Experts)'로 분할하여, 입력마다 관련 있는 일부만을 구동한다. 방대한 지식을 보유하면서도 1토큰당 계산량과 레이턴시(Latency)를 중규모 모델 수준으로 억제하는 것이 목표다. 프론티어급(Frontier-class) 응답 품질을 풀 사이즈 모델보다 가벼운 구동 환경으로 빌려 쓰는 이미지에 가깝다.
이 활성 수에 대해서는 보도 방식에 온도 차가 있다. testingcatalog는 MoE로 950억이 작동한다고 명시하며, Qwen3.5 아키텍처를 기반으로 한다고 전한다. 반면 MarkTechPost는 Alibaba가 활성 파라미터 수를 전면에 내세우지 않았다는 점을 지적했다. 숫자 그 자체보다 '총량만큼 계산하지 않는다'라는 설계 사상을 파악해 두면 된다. 문맥 길이(Context Length)는 최대 100만 토큰으로, 200페이지 이상의 문서나 100시간 규모의 영상을 1회 요청(Request)으로 처리할 수 있다고 설명되어 있다.
요금표를 보면 입력 100만 토큰당 2달러, 출력 6달러라는 프론티어급 치고는 저렴한 수준이 나열되어 있다. 하지만 정말 효과적인 것은 그 옆에 있는 cached input 행이다.
| 항목 | 100만 토큰당 |
|---|---|
| 입력(통상) | $2.00 |
| ... |
LLM의 API는 동일한 서문(시스템 프롬프트나 긴 문맥)을 매번 보낼 때마다 매번 전체 비용이 청구된다. 프리픽스 캐싱(Prefix Caching)은 직전 요청과 공통되는 도입부의 계산 결과를 재사용하여 그만큼을 크게 할인해 주는 메커니즘이다. Qwen3.8-Max에서는 암묵적 캐시(Implicit Cache)에 히트한 입력이 통상 입력의 8분의 1, 즉 0.25달러까지 떨어진다.
이 차이는 에이전트(Agent)처럼 긴 지시나 이력을 가진 채 동일한 서문으로 수십 번 모델을 호출하는 워크로드(Workload)에서 청구 금액을 좌우한다. 총 파라미터의 임팩트보다 이 0.25달러라는 행이 월말의 숫자에 더 큰 영향을 미친다는 것이 실무를 수행해 온 쪽의 실감이다.
이전을 검토하는 측에게 큰 장점은 호환성이다. Qwen3.8-Max는 OpenAI 호환 chat completions와 Responses API에 더해, Anthropic 호환 인터페이스까지 갖추고 있다. 기존 OpenAI SDK 코드를 사용한다면, 교체 작업은 접속 대상과 모델명만 바꾸는 것으로 끝난다.
Alibaba Cloud Model Studio supports API calls to models through OpenAI-compatible interfaces and the DashScope SDK.
(Alibaba Cloud Model Studio 문서)
공식 문서에서 확인할 수 있는 최소 호출은 다음과 같은 형태가 된다 (미국 리전의 예시. 타 리전에서는 base_url의 호스트가 바뀐다).
pip install openai
from openai import OpenAI
import os
client = OpenAI(
...
OpenAI()의 base_url을 DashScope 호환 엔드포인트로 향하게 하고, API 키를 DASHSCOPE_API_KEY에서 읽기만 하면 된다. 나머지는 모델 ID에 qwen3.8-max를 지정한다. 추론의 깊이는 xhigh / medium / low로 전환할 수 있으며, code_interpreter나 web_search 등 5종의 내장 도구도 준비되어 있다.
공개 시점에서 사용할 수 있는 것은 호스트 버전뿐이지만, Qwen은 다음 주 중으로 Hugging Face와 ModelScope에서 가중치(Weights)를 공개할 것이라고 예고했다. 게다가 2.4조의 본체와 더불어, Qwen3.8-27B라는 소형 체크포인트(Checkpoint)도 동시에 오픈 웨이트(Open Weights)로 공개된다. 2.4조 버전을 자체 GPU에 올릴 수 있는 현장은 거의 없으므로, 실제로 손에 쥐고 돌릴 수 있는 본명은 27B 쪽이라고 보고 있다. 이곳이 검증의 기점이 될 것이다.
성능 면에서는 터미널 조작의 Terminal-Bench 2.1에서 86.6, GUI 조작의 OSWorld-Verified에서 86.1, 코딩의 FrontierSWE가 이전 세대의 40.7에서 73.5로 크게 향상되었다고 한다. 다만 이 수치들은 모두 Qwen 자체의 공표된 값이며, 제3자에 의한 재현 실험(reproducibility test) 결과를 기다려보고 싶다. "Claude 3.5 Sonnet(Claude Fable 5)에 버금가는" 수준이라는 위치 선정 또한, 현시점에서는 벤더 측의 주장으로 받아들여 두는 것이 안전하다.
거대 모델 뉴스는 총 파라미터(parameter) 수로 승부를 겨루는 경향이 있지만, Qwen3.8-Max를 다룰 때 주목해야 할 점은 활성 파라미터 950억 개라는 계산량, KV 캐시(KV cache) 비용, 그리고 연결 대상 한 줄에 따라 바뀌는 호환성이라는 세 가지로 요약된다. 긴 문맥(long context)을 지속적으로 돌리는 에이전트(agent) 용도라면, 다음 주 오픈 웨이트(open weights) 모델, 그중에서도 27B 모델이 모두 출시된 이후에 본격적인 검증을 시작하는 것이 합리적이다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기