
오픈 웨이트 (Open-Weight)의 프런티어가 단 하루 만에 도래했다
요약
Thinking Machines Lab의 Inkling과 Moonshot AI의 Kimi K3가 연달아 출시되며 오픈 웨이트 모델의 기술적 한계가 급격히 상승했습니다. 두 모델 모두 거대 파라미터를 보유한 멀티모달 모델로, 오픈 소스 생태계의 프런티어 급 역량을 보여줍니다.
핵심 포인트
- Thinking Machines의 Inkling은 9,750억 파라미터 규모의 네이티브 멀티모달 모델임
- Moonshot AI의 Kimi K3는 2.8조 파라미터를 보유하며 코딩 성능에서 우수한 성적 기록
- 오픈 웨이트 모델의 역량 하한선이 급격히 상승하며 프런티어 모델의 정의가 변화 중
- Mira Murati의 신생 스타트업이 단 9개월 만에 시장에 강력한 영향력을 행사
오픈 웨이트 (Open-Weight)의 프런티어가 단 하루 만에 도래했다
7월 15일, 설립된 지 9개월 된 Mira Murati의 스타트업인 Thinking Machines Lab은 Inkling을 출시했습니다. 이는 9,750억 개의 파라미터(parameters), 410억 개의 활성 파라미터(active parameters)를 보유한 네이티브 멀티모달 (natively multimodal) 모델이며, Apache 2.0 라이선스를 따릅니다. 16시간 후, Moonshot AI는 Kimi K3를 출시했습니다. 2.8조 개의 파라미터를 가진 이 모델은 Frontend Code Arena에서 Claude Fable 5를 제치고 1위를 차지했으며, 7월 27일까지 완전한 오픈 웨이트 (open weights) 공개를 약속했습니다.
두 개의 독립적인 연구소. 두 개의 대륙. 단 하루. 이것은 우연이 아닙니다. 이는 역량의 하한선 (capability floor)이 영구적으로 상승하고 있음을 의미합니다.
X에서의 반응은 즉각적이었습니다. Thinking Machines의 공동 창립자인 Soumith Chintala는 이를 명확하게 표현했습니다:
그리고 시장의 판결은 어떠했을까요? Polymarket 트레이더들은 프런티어 연구소들의 해자 (moat)가 아닌, 중국의 AI 경쟁 구도를 재산정했습니다. 자세한 내용은 아래에서 다룹니다.
Inkling: 9개월의 선언문
Thinking Machines는 OpenAI의 5년, Anthropic의 3년과 비교했을 때 약 9개월 만에 시장 진입에 성공했습니다. 이 회사는 약 200명의 직원을 고용하고 있으며, 전 OpenAI CTO인 Mira Murati에 의해 설립되었습니다. Inkling 출시 5일 전, 이 연구소는 "Future Worth Building Is Human"이라는 제목의 선언문을 발표했으며, Inkling은 그러한 포지셔닝 뒤에 있는 기술적 베팅입니다.
아키텍처: 희소한 전문가 혼합 (Sparse Mixture-of-Experts, MoE) 백본을 갖춘 66개 레이어의 디코더 전용 트랜스포머 (Decoder-only Transformer)입니다. 각 토큰은 256개의 전문가 중 6개로 라우팅되며, 모든 토큰에 활성화되는 2개의 공유 전문가 (Shared Experts)가 추가됩니다. 총 파라미터 수는 9,750억 개이며, 추론 시 활성화되는 파라미터는 410억 개입니다. 텍스트, 이미지, 오디오, 비디오를 아우르는 45조 개의 토큰으로 사전 학습 (Pretrained)되었으며, 컨텍스트 윈도우 (Context Window)는 100만 토큰까지 확장됩니다.
여기서 흥미로운 점은 다음과 같습니다: Thinking Machines는 Inkling이 "현재 사용 가능한 오픈 또는 클로즈드 모델 중 전체적으로 가장 강력한 모델은 아니다"라고 명시적으로 밝히고 있습니다. 도구를 사용한 HLE 벤치마크에서 46.0%를 기록하며 Claude Fable 5의 64.5%에 못 미쳤고, SWE-Bench Verified에서는 Fable의 95.0% 대비 77.6%를 기록했습니다. 이 회사는 벤치마크의 지배력을 판매하는 것이 아니라, 커스터마이징 (Customize)할 수 있는 권리를 판매하고 있습니다.
ℹ️ Inkling의 SWE-Bench Verified 점수인 77.6%는 Fable 5보다 17포인트 뒤처지지만, Tinker를 통해 베이스 모델을 미세 조정 (Fine-tuning)하려는 팀들에게는 그 차이보다 라이선스가 더 중요합니다. Apache 2.0은 사용 제한이 없고, 모델 서비스형 (Model-as-a-service) 종속성이 없으며, 배포 전에 법무팀에 전화를 걸 필요가 없음을 의미합니다.
TechCrunch의 프레임워크는 비즈니스 논지를 잘 포착했습니다: Microsoft의 CEO Satya Nadella는 독점 모델을 사용하는 기업들이 구독 비용과 비즈니스 지식의 양보를 통해 "사실상 두 번 비용을 지불한다"고 경고한 바 있습니다. Inkling은 그 주장에 대한 기술적인 해답입니다.
Bill Gurley는 이를 더 넓은 전략적 변화와 연결 지었습니다:
Kimi K3: 역대 최대 규모의 오픈 웨이트 (Open-Weight) 모델
Inkling이 커스터마이징을 위한 승부수라면, Kimi K3는 가공되지 않은 규모의 선언입니다. Moonshot AI의 새로운 모델은 2.8조 개의 파라미터를 탑재하고 있으며, 이는 DeepSeek의 V4 Pro보다 약 75% 더 큰 규모로, 총 896개의 전문가를 갖춘 전문가 혼합 (Mixture-of-Experts) 아키텍처로 구성되어 있습니다.
기술적 혁신은 구체적이며 결코 사소하지 않습니다. Kimi Delta Attention (KDA)은 긴 컨텍스트 (long-context) 코딩 워크로드를 위해 설계된 하이브리드 선형 어텐션 (hybrid linear attention) 메커니즘입니다. Attention Residuals는 표준 잔차 연결 (residual connections)을 대체하며 깊이에 따라 표현 (representations)을 선택적으로 검색합니다. 이 모델은 MXFP4 가중치 (weights)와 MXFP8 활성화 (activations)를 사용하여 양자화 인식 훈련 (quantization-aware training) 방식으로 훈련되었으며, 이는 대규모 추론 효율성에 대한 베팅입니다.
벤치마크는 시장의 흐름을 보여줍니다. Artificial Analysis에서 K3는 지능 지수 (Intelligence Index) 57점을 기록했습니다. 이는 Opus 4.8 (56) 및 GPT-5.5와 대등한 수준이지만, Fable 5 (60)와 GPT-5.6 Sol (59)에는 여전히 뒤처져 있습니다. 하지만 Arena.ai의 Frontend Code Arena에서 K3는 1,679점을 기록하며 1위로 데뷔했습니다. 이는 Fable 5의 1,631점과 GPT-5.6 Sol의 1,618점을 앞지른 수치입니다.
가격 책정은 전략적 측면을 보여줍니다. K3는 입력 토큰 100만 개당 3달러, 출력 토큰 100만 개당 15달러를 부과하며, 이는 Anthropic의 Sonnet 시리즈와 일치합니다. 이는 역사적으로 채택을 유도하기 위해 보조금을 받는 듯한 저가 정책에 의존해 왔던 중국 AI 가격 책정 방식에서 크게 벗어난 것입니다. The Decoder가 언급했듯이, K3는 초저가 중국 AI 시대의 종말을 예고합니다. 모델이 프런티어 벤치마크에 부합한다면, 프런티어 연구소처럼 가격을 책정하게 됩니다.
가장 날카로운 평가 중 하나는 머신러닝 연구자인 @nrehiew_로부터 나왔으며, 그의 게시물은 몇 시간 만에 61.4만 회의 조회수를 기록했습니다.
예측 시장은 이미 그 파장을 가격에 반영했다
경쟁 구도를 추적하는 사람들에게 이곳은 매우 흥미로운 지점입니다. Polymarket의 "최고의 AI 모델 (7월 말)" 시장은 여전히 Anthropic이 97%를 차지하고 있으며, 이는 230만 달러의 유동성으로 뒷받침되는 거의 확실한 승리(near-lock) 상태입니다. 하지만 그 97%라는 수치는 전월 대비 6.2%포인트 하락했습니다. 하락세는 느리지만, 실재하며 방향성을 띠고 있습니다.
더 급격한 움직임은 중국의 AI 경쟁에서 나타났습니다. Polymarket의 "최고의 중국 AI 기업" 시장에서 Alibaba는 단 일주일 만에 40포인트가 폭락하며, 압도적인 선두 주자에서 54%라는 근소한 차이의 리드로 밀려났고, Moonshot은 42%로 급등했습니다. 6개월 전 담론을 주도했던 DeepSeek는 1%로 분류되어 사실상 제외되었습니다.
⚠️ 우리는 어제 Alibaba가 85%를 기록했을 때 중국 AI 시장이 "통합(consolidating)"되고 있다고 언급했습니다. 그 분석은 약 12시간 만에 유효성을 잃었습니다. 40포인트의 급격한 변동은 우리가 추적해 온 AI 예측 시장의 움직임 중 가장 날카로운 것 중 하나입니다. 교훈은 더욱 명확해졌습니다. 24시간 주기로 프런티어 모델(frontier models)이 출시되는 분야에서 "통합"이라는 단어는 위험합니다.
여기서 얻을 수 있는 결론은 Anthropic의 위치가 붕괴되고 있다는 것이 아닙니다. 아직은 분명히 그렇지 않습니다. 핵심은 예측 시장이 어디에서 파괴적 혁신(disruption)의 가격을 책정했느냐 하는 점입니다. 트레이더들은 두 건의 오픈 웨이트 (Open-Weight) 출시를 지켜본 후, 경쟁적 위협이 서구의 프런티어에 맞서는 것이 아니라 중국 자체 생태계
_내부_에서 발생하고 있다고 결론지었습니다. Moonshot이 Alibaba의 점유율을 잠식하고 있다는 것이 돈이 말해주는 이야기입니다.
하지만 Anthropic의 "최고 모델" 점유율에서 나타난 월간 6.2%의 하락을 주목하십시오. 이것은 선행 지표와 후행 지표 사이의 차이입니다. 오늘날에는 이것이 소음(noise)으로 등록됩니다. 만약 오픈 웨이트 출시가 이 정도의 템포로 계속된다면, Polymarket의 합의(consensus)는 유통기한이 짧을 것입니다.
훈련 계보(Training-Lineage)의 비밀이 밝혀지다
백악관의 전직 AI 선임 정책 고문인 Sriram Krishnan은 이러한 구조적 변화를 다음과 같이 포착했습니다:
이것은 조용한 폭탄입니다. 3주 전 우리가 GLM-5.2 vs Opus 4.8을 다루었을 때, 질문은 단일 오픈 웨이트 (Open-weight) 모델이 프런티어 (Frontier) 벤치마크에 필적할 수 있는지 여부였습니다. GLM-5.2는 적어도 코딩 분야에서는 그것이 가능하다는 것을 증명했습니다.
Inkling과 K3가 증명한 것은 다른 차원의 이야기입니다. 이 훈련 레시피 (Training recipe)는 서로 다른 대륙에서, 서로 다른 아키텍처 (Architecture)를 사용하며, 서로 다른 일정으로 운영되는 독립적인 팀들에 의해 복제 가능합니다. 한 연구소는 RoPE 대신 Muon 최적화 (Optimization)와 상대적 위치 임베딩 (Relative positional embeddings)을 사용했습니다. 다른 연구소는 Kimi Delta Attention을 처음부터 발명했습니다. 두 곳 모두 동일한 24시간의 시간 범위 내에서 프런티어 경쟁력을 갖춘 결과에 도달했습니다.
더 넓은 패턴을 도출하며 Jason Calacanis는 다음과 같이 언급했습니다: "지난 1년 동안보다 지난 30일 동안 수십 명의 플레이어들에 의해 상황이 더 가속화되었습니다. 오픈 소스 (Open source) 모델들은 복리로 성장하고 있습니다. 프런티어 (Frontier) 모델들은 정교해지고 있습니다."
이는 우리가 프런티어 출시 전쟁 보도에서 추적했던 논지와 직접적으로 연결됩니다: "최고의 모델"과 "충분히 좋은 모델" 사이의 격차는 그 누구의 가격 모델이 예상하는 것보다 더 빠르게 압축되고 있습니다.
지정학으로서의 Apache 2.0
Inkling의 Apache 2.0 라이선스는 단순한 개발자 관계 (Developer-relations) 차원의 선택이 아닙니다. Substack에 게재된 Pablo Chavez의 분석에 따르면, 전 세계 소버린 AI (Sovereign AI) 모델 프로젝트의 86%가 웨이트 (Weights)를 공개적으로 배포하고 있으며, Alibaba의 Qwen이 UAE에서 태국, 우간다에 이르기까지 소버린 AI 배포 환경에 등장하기 시작했다는 사실이 기록되어 있습니다.
지정학적 논리는 명확합니다. 미국 정부는 프런티어 모델 (frontier models)에 대한 국제적 접근을 강제로 중단시킬 수 있음을 입증했습니다. 하지만 오픈 웨이트 (Open weights)는 한 번 다운로드되면 끌 수 없습니다. 미국 이외의 정부나 기업에게 있어, 독점적 API (proprietary API)와 Apache 2.0 체크포인트 (checkpoint)의 차이는 임대된 역량과 주권적 역량의 차이입니다.
Thinking Machines와 Moonshot은 서로 반대되는 입장에서 동일한 라이선싱 결론에 도달했습니다. Murati의 연구소는 이를 "검열에 대한 저항 (resistance to censorship)" 및 기업의 자기 결정권으로 정의합니다. Moonshot은 이를 폐쇄적인 중국 경쟁사들에 맞선 경쟁적 차별화로 정의합니다 (이로 인해 Polymarket에서 Alibaba의 가치가 하락했습니다). 그러나 그 파생 효과는 동일합니다. 더 많은 프런티어급 웨이트 (frontier-grade weights)가 유통되면서, 특정 정부나 기업이 접근을 통제하기가 더 어려워집니다.
💡 오픈 웨이트를 주권으로 보는 논제는 우리가 왜 중국 코딩 모델의 급증을 추적해 왔는지와 연결됩니다. 모든 오픈 릴리스 (open release)는 하한선을 높입니다. 폐쇄형 연구소들에게 던져진 질문은 더 이상 "누군가 우리를 따라잡을 수 있을까?"가 아니라, "우리 수준에 도달하는 것이 언제쯤 기본 요건 (table stakes)이 될 것인가?"입니다.
커뮤니티의 반응
두 출시 모두에 대한 Hacker News 스레드는 이번 달 가장 활발한 AI 토론 중 하나였습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기


