Thinking Machines Inkling: 975B 오픈 웨이트 (Open-Weight) 모델
요약
Thinking Machines Lab에서 출시한 975B 규모의 오픈 웨이트 MoE 모델 Inkling을 소개합니다. 이 모델은 맞춤화(customization)를 목적으로 설계되었으며, Apache 2.0 라이선스로 공개되어 기업들이 미세 조정하기에 최적화되어 있습니다.
핵심 포인트
- 975B 총 파라미터 및 41B 활성 파라미터의 MoE 아키텍처
- 텍스트, 이미지, 오디오, 비디오를 포함한 45T 토큰 학습
- Apache 2.0 라이선스로 제공되는 진정한 오픈 웨이트 모델
- 미세 조정 플랫폼 Tinker를 통한 커스터마이징 중심의 비즈니스 모델
Thinking Machines Inkling은 Mira Murati의 Thinking Machines Lab에서 출시한 첫 번째 모델로, 2026년 7월 15일에 Apache 2.0 라이선스 하에 공개되었습니다. 이 모델은 9750억 개의 파라미터를 가진 전문가 혼합 (Mixture-of-Experts, MoE) 모델이며, 순전파 (forward pass) 당 410억 개의 활성 파라미터를 가집니다. 텍스트, 이미지, 오디오 및 비디오를 아우르는 45조 개의 토큰으로 학습되었으며, 100만 토큰의 컨텍스트 윈도우 (context window)를 제공합니다. 가중치 (weights)는 Hugging Face에서 자유롭게 다운로드할 수 있으며, 회사는 이 모델에 대한 종량제 API 액세스를 명시적으로 판매하지 않고 있습니다.
특이한 점은 규모가 아닙니다. 바로 명시된 목표입니다. Thinking Machines는 대부분의 기업이 가장 똑똑한 범용 모델을 필요로 하는 것이 아니라, 자신들만의 것으로 만들 수 있는 모델을 필요로 한다고 주장하며, 리더보드(leaderboard) 1위를 차지하는 것에는 공개적으로 관심이 없음을 밝혀왔습니다. Inkling은 맞춤화 (customization)를 위한 베이스로 설계되었으며, 이 회사의 미세 조정 (fine-tuning) 플랫폼인 Tinker가 실제 제품입니다.
아래에서는 전체 사양, "맞춤화를 위해 구축되었다"는 것이 실제로 무엇을 의미하는지, 2026년의 다른 오픈 웨이트 (open-weight) 옵션들과 비교했을 때 어떤 위치에 있는지, 그리고 누가 이 모델을 선택해야 하고 누가 선택하지 말아야 하는지에 대한 솔직한 평가를 다룹니다.
핵심 요약
- Inkling은 2026년 7월 15일 Apache 2.0 라이선스 하에 출시되었습니다. 이는 소스 공개형 (source-available) 유사 라이선스가 아닌, 진정으로 허용적인 라이선스입니다.
- 총 975B 파라미터, 41B 활성 파라미터, 텍스트/이미지/오디오/비디오를 포함한 45T 토큰 학습, 1M 토큰 컨텍스트 윈도우를 보유하고 있습니다.
- 동반 모델인 Inkling-Small은 더 저렴하고 빠른 추론 (inference)을 위해 총 276B / 활성 12B 규모의 MoE 모델로 제공됩니다.
- 가중치는 Hugging Face에 있으며, 호스팅된 추론 서비스는 Together AI, Fireworks, Modal, Databricks 및 Baseten에서 이용 가능합니다.
- Thinking Machines는 토큰당 API 가격 책정을 통해 Inkling으로 수익을 창출하지 않습니다. 비즈니스 모델은 미세 조정 플랫폼인 Tinker입니다.
Thinking Machines Inkling란 무엇인가?
Thinking Machines Inkling은 완성된 제품이라기보다 커스터마이징을 위한 기반(customization base)으로 구축된 오픈 웨이트 (Open-Weight), 네이티브 멀티모달 (natively multimodal) 파운데이션 모델 (foundation model)입니다. 이 모델은 전문가 혼합 (Mixture-of-Experts, MoE) 아키텍처를 사용합니다. 모델에는 9,750억 개의 파라미터 (parameters)가 존재하지만, 특정 토큰에 대해 활성화되는 파라미터는 약 410억 개에 불과하며, 이것이 추론 비용 (inference cost)을 일반 기업이 실제로 지불할 수 있는 범위 내로 유지해 주는 핵심입니다.
여기서 네이티브 멀티모달리티 (Native multimodality)는 특정한 방식으로 중요합니다. 많은 "멀티모달" 모델들은 텍스트 모델에 비전 (vision) 기능을 나중에 덧붙인 형태입니다. 반면 Inkling은 처음부터 텍스트, 이미지, 오디오, 비디오를 가로질러 사전 학습 (pretrained)되었으며, 이는 일반적으로 더 나은 교차 모달 접지 (cross-modal grounding)를 생성하고 — 미세 조정 (fine-tuning) 관점에서 더 관련이 깊은데 — 베이스 모델 (base model)과 충돌하지 않으면서 혼합 모달리티 도메인에 적응하는 표현 공간 (representation space)을 만들어냅니다.
TechCrunch는 이번 출시를 '모두에게 적용되는 단일 AI (one-size-fits-all AI)'에 반대하는 베팅이라고 평가했으며, 이는 정확한 해석입니다. Axios는 2024년 말까지 OpenAI의 CTO였던 Murati가 회사를 설립한 이후, 이 모델이 해당 연구소의 첫 자체 개발 모델이라고 언급했습니다.
Inkling 사양 한눈에 보기
| 사양 (Spec) | Inkling | Inkling-Small |
|---|---|---|
| 총 파라미터 (Total parameters) | 975B | 276B |
| ... |
계획을 세울 때 기준으로 삼아야 할 수치는 41B의 활성 파라미터 (active parameter) 수입니다. 이는 메모리 대역폭 (memory bandwidth)을 결정하며, 결과적으로 서빙 비용 (serving cost)을 결정합니다. 서빙 스택 (serving stack)이 전문가 라우팅 (expert routing)을 효율적으로 처리한다는 전제하에, 41B의 파라미터가 활성화되는 975B 모델은 추론 시점에 1조 개의 파라미터를 가진 모델보다는 41B 밀집 (dense) 모델처럼 동작합니다. 하지만 저장 및 로딩은 전체 975B에 의해 제어되며, 이는 셀프 호스팅 (self-hosting)의 실질적인 장벽이 됩니다.
대안들과 비교해 보십시오: DeepSeek의 V4 Flash는 총 284B / 활성(active) 13B로 동작하며 API 우선(API-first) 방식인 반면, Inkling은 크기가 대략 3배 더 크며 가중치 우선(weights-first) 방식입니다. 용도에 따라 도구가 다릅니다 — 만약 토큰당 순수 비용이 제약 사항이라면 당사의 DeepSeek V4 Flash 0731 분석을 참조하십시오.
Inkling을 실제로 어떻게 사용하나요?
노력의 정도가 낮은 순서부터 높은 순서대로 세 가지 경로가 있습니다.
1. 호스팅된 추론 (Hosted inference). 가장 빠른 경로입니다. Inkling은 Together AI, Fireworks, Modal, Databricks 및 Baseten에서 라이브로 제공됩니다. 대부분은 OpenAI 호환 엔드포인트(OpenAI-compatible endpoint)를 노출합니다:
curl https://api.together.xyz/v1/chat/completions \
-H "Authorization: Bearer $TOGETHER_API_KEY" \
-H "Content-Type: application/json" \
...
2. Tinker를 통한 미세 조정 (Fine-tuning on Tinker). 이것이 의도된 경로이자 회사의 비즈니스 모델입니다. 도메인 데이터셋을 가져오면 Tinker가 훈련 인프라를 처리하고, 여러분은 맞춤화된 모델을 돌려받게 됩니다.
3. 가중치 셀프 호스팅 (Self-hosting the weights). Apache 2.0 라이선스 하에 완전히 가능하지만 진정으로 까다로운 작업입니다. 975B 파라미터를 다운로드하는 것은 단 하나의 토큰을 서빙하기 전부터 심각한 저장 공간 및 네트워킹 과제를 안겨주며, MoE 라우팅 (MoE routing)을 잘 처리하는 서버가 필요할 것입니다:
# 가중치 가져오기 (시간이 오래 걸리고 많은 디스크 공간이 필요할 것으로 예상됨)
huggingface-cli download thinking-machines/inkling --local-dir ./inkling
...
줄어든 --max-model-len에 주목하십시오. 모델은 100만 토큰을 지원하지만, 여러분의 KV 캐시 (KV cache) 예산은 아마 그렇지 않을 것입니다. 최대치보다 훨씬 낮은 수준에서 시작하고, 메모리 여유 공간 (memory headroom)을 측정한 후에만 값을 높이십시오. 당사의 vLLM vs Ollama 비교에서는 왜 서빙 엔진의 선택이 이 등급의 모델에서 처리량 (throughput)을 결정짓는지 다루고 있으며, LLM을 로컬에서 실행하는 방법에서는 동일한 문제의 더 작은 규모 버전을 다룹니다.
Inkling이 다른 오픈 웨이트 (Open-weight) 모델보다 더 나은가요?
일반적인 벤치마크 (Benchmarks) 기준으로는 그렇지 않으며, Thinking Machines 측에서도 이를 직접적으로 밝히고 있습니다. 이 회사는 Inkling이 현재 사용 가능한 가장 강력한 모델은 아니며, Inkling의 장점은 커스터마이징 (Customization) 전이 아닌 후에 나타난다는 점을 이례적일 정도로 솔직하게 말해왔습니다.
이는 정직하면서도 다소 위험한 입장입니다. 벤치마크 점수는 모델이 채택되는 방식이며, 이를 두고 경쟁하기를 거부한다는 것은 시장의 대부분의 무료 관심(attention)을 거부한다는 것을 의미하기 때문입니다. 이들의 도박은 특정 도메인에 맞춰 파인튜닝 (Fine-tuned)된 41B-active 모델이 해당 도메인에서 범용 프런티어 모델 (Frontier model)을 이길 것이라는 점에 걸려 있습니다. 저희가 프로덕션 파인튜닝 (Production fine-tuning)을 경험한 바에 따르면, 이는 좁고 잘 정의된 작업(narrow, well-specified tasks)에 대해서는 빈번하게 사실이지만, 개방형 추론 (Open-ended reasoning)에 대해서는 빈번하게 거짓입니다.
만약 모델을 파인튜닝해 본 적이 없다면, 워크플로 (Workflow)를 배우기 위해 더 작고 저렴한 것부터 시작하세요. Unsloth 및 더 빠른 LLM 파인튜닝 가이드는 여러분이 이미 보유하고 있을 법한 하드웨어에서 작동하는 메커니즘을 단계별로 설명합니다.
Apache 2.0 라이선스가 파라미터 수보다 더 중요한 이유
"오픈 웨이트 (Open weights)"는 AI 분야에서 가장 신뢰하기 어려운 문구 중 하나가 되었습니다. 널리 사용되는 여러 모델이 월간 활성 사용자 수(MAU)를 제한하거나, 경쟁 제품을 금지하거나, 전체 애플리케이션 카테고리를 제한하거나, 나중에 약관을 변경할 권리를 보유하는 맞춤형 라이선스 (Bespoke licences) 하에 배포됩니다. 법적으로 이것들은 오픈 소스 (Open source)가 아닙니다. 이는 조건부 배포 계약 (Conditional distribution agreements)이며, 기업의 법무팀이 거절 의사를 밝히게 만드는 바로 그러한 모호함을 만들어냅니다.
Apache 2.0는 그러한 논쟁 자체를 제거합니다. 이는 사용량 제한, 수익 임계값, 용도 제한이 없으며 명시적인 특허 허여 (patent grant)를 포함하는 OSI 승인 라이선스입니다. 실제로 마지막 조항은 개발자들이 예상하는 것보다 더 중요합니다. 특허 허여는 라이선스 제공자가 귀하의 모델 사용에 대해 특허권을 주장하는 것으로부터 귀하를 보호하며, 이는 맞춤형 "커뮤니티 라이선스 (community licence)"가 신뢰성 있게 제공하지 못하는 부분입니다.
Inkling을 검토하는 팀에게 미치는 실질적인 결과는 다음과 같습니다:
- 이를 기반으로 경쟁 제품을 구축할 수 있습니다. 라이선스의 어떤 내용도 Inkling을 기반으로 구축된 상업적 AI 서비스를 출시하는 것을 방지하지 않으며, 심지어 Thinking Machines와 경쟁하는 제품이라 할지라도 마찬가지입니다.
- 포크 (fork) 및 재배포가 가능합니다. 미세 조정 (Fine-tune)하고, 결과물의 이름을 변경하고, 파생물을 게시하고, 판매하십시오. 저작자 표시 (Attribution)와 라이선스 전문을 유지하는 것만이 유일한 의무입니다.
- 조건을 소급하여 취소할 수 없습니다. 귀하가 다운로드한 버전은 다운로드 당시 적용된 조건에 따라 라이선스가 유지됩니다.
- 조달 검토 (Procurement review)가 짧습니다. Apache 2.0은 이미 거의 모든 기업의 사전 승인된 라이선스 목록에 포함되어 있어, 맞춤형 라이선스가 유발했을 수 주간의 법적 검토 과정을 생략할 수 있습니다.
아무도 해석할 수 없는 라이선스 조항 때문에 정말 유망한 모델이 조달 과정에서 거절되는 것을 지켜본 사람이라면, 이것은 단순한 각주가 아닙니다. 건강한 허용적 생태계 (permissive ecosystem)가 무엇을 가능하게 하는지에 대한 더 넓은 관점은 당사의 오픈 소스 AI 개발 도구 (open source AI developer tools) 모음집을 참조하십시오.
주목할 만한 관점: 워크플로우를 판매하기 위해 모델을 무료로 제공함
대부분의 보도는 이를 "또 다른 오픈 웨이트 (open-weight) 출시"로 다루었습니다. 더 흥미로운 이야기는 비즈니스 모델에 있는데, 이는 표준적인 AI 경제학을 뒤집기 때문입니다.
현재 모든 주요 연구소(lab)는 추론 (inference)을 통해 수익을 창출합니다. 즉, 사용자는 토큰당 비용을 영구적으로 지불하며, 모델 자체가 상품이 됩니다. 반면, Thinking Machines는 모델을 Apache 2.0 라이선스로 무료로 제공하고, _커스터마이징 (customization)_을 통해 수익을 창출합니다. 이는 사용자가 모델을 자신에게 맞게 최적화하는 데 성공할 때 회사가 이익을 얻는다는 것을 의미합니다. 이는 사용자의 프롬프트가 길어지고 사용량이 늘어날 때 이익을 얻는 토큰당 과금 방식의 판매자와는 정반대의 인센티브 구조입니다.
여기에는 실질적인 전략적 논리가 깔려 있습니다. 추론 (inference)은 빠르게 범용화(commoditizing)되고 있습니다. 100만 토큰의 가격은 18개월 만에 대략 한 자릿수(order of magnitude) 수준으로 폭락했으며, 앞으로도 계속 하락할 것입니다. 반면 파인튜닝 (fine-tuning) 워크플로우, 평가 하네스 (evaluation harnesses), 그리고 베이스 모델을 특정 도메인에 적응시키는 운영 지식은 훨씬 더 강력한 고착도 (stickiness)를 가집니다. 만약 Murati의 말대로 지속 가능한 가치가 원시 능력 (raw capability)이 아닌 커스터마이징 (customization)에 있다면, 이는 시의적절한 시장 선점 전략입니다. 만약 그녀가 틀렸다면, Thinking Machines는 누구나 구축할 수 있는 서비스를 판매할 특권을 얻기 위해 매우 값비싼 자산을 무료로 내준 셈이 됩니다.
어느 쪽이든 개발자들에게는 승리입니다. 비즈니스 가설의 성립 여부와 관계없이, 100만 토큰의 컨텍스트 창 (context window)을 가진 허용 범위가 넓은 라이선스의 975B 멀티모달 (multimodal) 모델은 오픈 생태계에 진정한 선물입니다.
자주 묻는 질문 (Frequently Asked Questions)
Thinking Machines Inkling이란 무엇인가요?
Inkling은 Thinking Machines Lab에서 출시한 첫 번째 파운데이션 모델 (foundation model)로, 2026년 7월 15일 Apache 2.0 라이선스로 공개되었습니다. 이 모델은 410억 개의 활성 파라미터 (active parameters)를 가진 9,750억 파라미터 규모의 전문가 혼합 (mixture-of-experts, MoE) 모델이며, 텍스트, 이미지, 오디오, 비디오에 걸친 45조 개의 토큰으로 학습되었고, 100만 토큰의 컨텍스트 창 (context window)을 제공합니다.
Inkling을 상업적으로 정말 무료로 사용할 수 있나요?
네. Inkling은 가장 허용 범위가 넓은 오픈 소스 라이선스 중 하나인 Apache 2.0 라이선스로 제공되며, 사용 제한, 수익 임계값, 또는 사용 분야에 대한 제한이 없습니다. 모델을 다운로드, 수정, 배포할 수 있으며 이를 기반으로 구축된 제품을 판매할 수도 있습니다.
Inkling-Small의 크기는 어느 정도인가요?
Inkling-Small은 총 2760억 개의 파라미터(parameters)를 보유하고 있으며, 그중 120억 개의 활성 파라미터(active parameters)를 사용하는 전문가 혼합 (Mixture-of-Experts, MoE) 모델로, 더 빠르고 저렴한 추론 (inference)이 필요한 팀을 대상으로 합니다. 이 모델은 플래그십 모델과 함께 프리뷰 버전으로 출시되었습니다.
자체 GPU 없이 어디에서 Inkling을 실행할 수 있나요?
Together AI, Fireworks, Modal, Databricks 및 Baseten에서 호스팅된 추론 (hosted inference) 서비스를 이용할 수 있습니다. 미세 조정 (fine-tuning)의 경우, Thinking Machines는 자체 커스터마이징 플랫폼인 Tinker를 제공합니다.
Inkling이 DeepSeek나 Llama보다 더 나은가요?
일반적인 벤치마크 (benchmarks) 기준으로는 그렇지 않습니다. Thinking Machines는 Inkling이 현재 사용 가능한 가장 강력한 모델은 아니라고 솔직하게 밝혔습니다. Inkling의 강점은 4가지 모달리티 (modalities)에 걸친 네이티브 사전 학습 (native pretraining) 덕분에, 특히 멀티모달 (multimodal) 영역에서 미세 조정 (fine-tuning)을 위한 매우 우수한 베이스 모델이 될 수 있다는 점에 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기