
중국의 오픈 모델 공세가 본격화되었습니다: Qwen 3.8-Max가 2.4T 가중치를 무료로 공개했습니다
요약
Alibaba가 2.4조 개의 파라미터를 가진 초거대 오픈 가중치 모델 Qwen 3.8-Max를 출시했습니다. 이 모델은 MoE 구조와 100만 토큰의 컨텍스트 윈도우를 지원하며, 주요 벤치마크에서 Claude Sonnet 5와 대등한 성능을 보여줍니다.
핵심 포인트
- 2.4T 파라미터 규모의 초거대 MoE 모델 출시
- Claude Sonnet 5 및 GPT-5.6 Luna와 경쟁 가능한 성능
- Hugging Face를 통해 오픈 가중치로 공개 예정
- 고성능 모델을 위한 하드웨어 요구사항(Nvidia B200 등) 명시
- 상대적으로 저렴한 API 가격 경쟁력 확보
올해 AI 분야를 지켜봐 오셨다면, 이미 그 패턴을 알고 계실 것입니다. 미국 연구소들은 API 뒤에 숨겨진 인상적인 무언가를 발표합니다. 중국 연구소들은 경쟁력 있는 무언가를 오픈 가중치 (open weights)로 공개합니다. 미국 측은 안전 (safety)에 대해 이야기합니다. 나머지 우리들은 그저 중국 모델을 다운로드하고 일상을 이어갑니다.
하지만 이번 주는 다르게 느껴졌습니다. 패턴이 바뀌어서가 아니라, 규모 (scale)가 달라졌기 때문입니다.
지난 48시간 동안 어떤 일이 일어났는지 안내해 드리겠습니다.
Alibaba가 역대 최고의 모델을 무료로 출시했습니다
Alibaba는 월요일에 Qwen 3.8-Max를 출시했으며, 그 수치는 무시하기 어렵습니다. 총 2.4조 (2.4 trillion) 개의 파라미터 (parameters), 쿼리당 950억 개 활성화 (95 billion activated per query, mixture-of-experts), 100만 토큰 컨텍스트 윈도우 (context window)를 갖추고 있습니다. 그들은 이 모델이 대부분의 벤치마크 (benchmarks)에서 Claude Sonnet 5와 대등하며, 코딩 작업에서는 GPT-5.6 Luna를 능가한다고 주장합니다.
저는 벤치마크를 자세히 살펴보는 데 시간을 보냈습니다. Artificial Analysis의 독립적인 평가 (evals)에 따르면 Alibaba 자체 차트보다는 약간 낮게 측정되었지만 (Opus 5보다는 Sonnet 5에 가깝게), 이는 여전히 엄청난 영역입니다. Frontend Code Arena에서 1,668점을 기록했는데, 이는 Claude Opus 5보다 단 37점 뒤처진 점수입니다. 직접 다운로드하여 자신의 하드웨어에서 실행할 수 있는 모델이라는 점을 고려하면, 이는 정말 놀라운 일입니다.
가격 책정이 진짜 이야기를 들려줍니다. Qwen 3.8-Max는 Alibaba의 API에서 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 6달러의 비용이 듭니다. Claude Sonnet 5는 입력 비용은 동일하지만 출력 비용은 100만 개당 10달러이며, 이는 9월 1일에 50% 인상될 예정입니다. OpenAI의 GPT-5.6 Luna는 입력 비용이 0.20달러로 더 저렴하지만, 측정 가능한 수준으로 더 낮은 결과를 얻게 됩니다.
Alibaba는 다음 주 Hugging Face에 가중치(weights)를 공개할 예정이며, B200 클러스터를 보유하지 않은 사용자들을 위해 270억 파라미터(27-billion parameter) 버전도 함께 출시할 것이라고 밝혔습니다. 왜냐하면, 2.4T 파라미터는 결코 만만한 규모가 아니기 때문입니다. 프로덕션 서빙(production serving)을 위해서는 4864개의 Nvidia B200이 필요하며, 내부 워크로드(internal workloads)를 위해서는 816개의 B300이 필요합니다. 라즈베리 파이(Raspberry Pi) 프로젝트 수준은 아니라는 뜻입니다.
그럼에도 불구하고, 이것이 오픈 가중치(open weights)로 존재한다는 사실 자체가 논의의 판도를 바꿉니다.
DeepSeek의 반격
Alibaba만이 소리를 높이고 있는 중국 연구소는 아니었습니다. DeepSeek는 V4 Flash 0731을 출시했습니다. 이 2,840억 파라미터(284-billion parameter) 모델은 독립적인 벤치마크에서 작업당 비용이 40% 더 저렴하면서도, 어떻게 된 일인지 GPT-5.6 Luna와 단 1점 차이 내외의 성능을 보여주었습니다.
흥미로운 점은 무엇일까요? 이 모델은 적당한 기업용 서버에서도 실행할 수 있을 만큼 충분히 작다는 것입니다. 284B 파라미터는 약 142GB의 메모리에 들어갑니다. 이 모델을 실험하기 위해 슈퍼컴퓨터 클러스터를 빌릴 필요가 없습니다.
DeepSeek의 전략은 항상 효율성에 초점을 맞춰 왔습니다. 즉, 가능한 한 적은 파라미터에서 성능을 최대한으로 쥐어짜는 것입니다. V4 Flash는 그러한 철학의 정점입니다. 순수 성능(raw capability) 면에서는 Qwen 3.8-Max를 이기지 못하겠지만, 많은 실제 사용 사례(real-world use cases)에서는 더 실용적입니다. 더 빠른 추론(inference), 더 낮은 비용, 더 쉬운 배포가 가능하다는 뜻입니다.
저는 코드 보조를 위해 몇몇 작은 DeepSeek 변체(variants)들을 로컬에서 실행해 왔는데, 솔직히 말해서 "작지만 오픈된 모델"과 "거대하지만 폐쇄적인 모델" 사이의 격차는 매달 좁혀지고 있습니다. V4 Flash는 그 추세를 더욱 가속화했습니다.
한편, Anthropic은 100억 달러 규모의 수표를 쓰고 있습니다
태평양 반대편에서 Anthropic은 분명히 압박을 느끼고 있습니다. 이번 주 Bloomberg의 보도에 따르면, Anthropic은 올해 초에 존재조차 하지 않았던 클라우드 스타트업인 Volta와 100억 달러 규모의 컴퓨팅 계약을 체결했습니다.
이 계약은 6년 동안 유지됩니다. Volta는 암호화폐 채굴 기업인 Bitdeer의 도움을 받아 Nvidia의 Vera Rubin 시스템을 기반으로 노르웨이에 133메가와트 규모의 데이터 센터를 구축하고 있습니다. Anthropic은 최근 SpaceX 및 Amazon과도 컴퓨팅 계약을 체결했습니다.
컴퓨팅 (Compute)에 들어가는 엄청난 비용입니다. 이는 Anthropic이 어디에 집중하고 있는지를 보여줍니다. 그들은 격차를 줄이기 위해 효율성 향상 (efficiency gains)에 도박을 걸고 있지 않습니다. 그들은 무차별적인 힘 (brute force)에 도박을 걸고 있습니다.
공정하게 말하자면, Claude Opus 5는 여러 벤치마크 (benchmarks)에서 여전히 돈으로 살 수 있는 최고의 모델입니다. 하지만 격차는 빠르게 줄어들고 있으며, 중국의 오픈 모델 (open models)들이 더 저렴하고 좋아지는 동안 Anthropic의 비용은 상승하고 있습니다. 무언가는 변화해야만 합니다.
광학 칩 (Optical Chips)과 하드웨어 경쟁
25세의 중퇴자가 설립한 런던 기반의 스타트업 Olix Computing은 이번 주 Netflix 공동 창립자인 Reed Hastings와 Arm Holdings로부터 3억 1,200만 달러를 유치했습니다. 이들의 접근 방식은 이례적입니다. HBM 메모리가 전혀 없는 DX-1이라는 칩을 사용하여, 전적으로 온칩 SRAM (on-chip SRAM)에 의존하며, 구리 대신 빛을 사용하는 광학 상호 연결 (optical interconnects)로 연결됩니다.
그들은 1,000억 파라미터 (100-billion-parameter) 모델에서 초당 10,000 토큰 (tokens)을 구현한다고 주장합니다. 이는 매우 빠른 속도입니다. HBM이 없다는 것은 고급 패키징 (advanced packaging) 비용이 들지 않음을 의미하며, 광학 상호 연결은 값비싼 디지털 신호 처리기 (digital signal processors)가 필요 없는, 더 느리지만 더 신뢰할 수 있는 인코딩 (encoding)을 사용합니다.
Olix의 기업 가치는 현재 33억 달러로 평가됩니다. 첫 출하물은 2027년 상반기에 예상됩니다. 아직 초기 단계이지만 방향은 옳습니다. 업계는 추론 (inference)을 위해 Nvidia의 GPU 독점에 대한 대안을 절실히 필요로 하고 있습니다.
짧은 소식들 (Quick Bits)
- SpaceX의 AI 클라우드 사업이 26억 달러의 매출을 기록했습니다 (전년 대비 3배 증가). 이는 주로 Anthropic 및 Google과의 컴퓨팅 (compute) 계약에서 발생했습니다. 이들은 CoreWeave의 경쟁자로 자리매김하고 있습니다.
- 공유 AI 메모리로서의 Obsidian — 누군가가 MCP를 통해 자신의 Obsidian 보관함 (vault)을 Claude Code, Codex, 그리고 로컬 LLM (Large Language Models)을 위한 공유 컨텍스트 (shared context)로 만드는 방법을 찾아냈습니다. 저도 이와 유사한 작업을 해왔는데, 이는 이러한 도구들을 사용하는 방식을 진정으로 변화시킵니다. 당신의 지식 베이스 (knowledge base)가 모델의 메모리가 되는 것입니다.
- Hank Green이 비판을 받았습니다 — 자신의 창작 워크플로 (creative workflow)에서 과도하게 LLM을 사용했다는 이유로 팬층으로부터 비판을 받았습니다. 논란은 실제 상황이지만, 근본적인 질문은 사라지지 않습니다: 도구와 의존 사이의 경계는 어디인가?
- 태국이 ThaiLLM을 출시했습니다 — AI 주권 (AI sovereignty)을 위한 자국 모델 노력입니다. 더 많은 국가들이 자신들의 언어 모델 (language models)을 미국이나 중국 기업에 아웃소싱하고 싶어 하지 않는다는 사실을 깨닫고 있습니다.
이번 주의 소식은 여기까지입니다. 오픈 모델 (Open models)이 가격과 가용성 모두에서 앞서나가고 있습니다. 폐쇄형 연구소 (Proprietary labs)들은 컴퓨팅 (compute)에 내일이 없는 것처럼 돈을 쓰고 있습니다. 하드웨어 스타트업들은 추론 (inference) 병목 현상을 해결하기 위해 노력하고 있습니다.
이 경주에서 누가 승리할지는 모르겠습니다. 하지만 누가 혜택을 입는지는 알고 있습니다 — 모델을 다운로드하여 직접 실행할 수 있는 모든 사람입니다.
이 내용이 유용했다면, 제가 이 모든 것들을 추적하기 위해 사용하고 있는 도구인 7x24planning을 확인해 보세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기