Inkling: Thinking Machines, 975B 파라미터 MoE 및 1M 컨텍스트 모델 출시
요약
Thinking Machines Lab이 9,750억 파라미터 규모의 MoE 모델인 Inkling을 공개했습니다. 이 모델은 100만 토큰의 컨텍스트를 지원하며, 오픈 가중치 방식으로 제공되어 누구나 자신의 인프라에서 실행 및 수정이 가능합니다.
핵심 포인트
- 9,750억 총 파라미터 중 추론 시 410억 개만 활성화되는 MoE 구조
- 텍스트, 이미지, 오디오, 비디오를 포함한 45조 개 토큰 사전 학습
- 최대 100만 토큰의 대규모 컨텍스트 창 지원
- 모델이 스스로 데이터를 생성하고 평가하는 재학습 능력 증명
- 경량화 버전인 Inkling-Small 및 파인튜닝 플랫폼 Tinker 제공
Thinking Machines Lab은 2026년 7월 15일, 총 9,750억 개의 파라미터와 추론 시 410억 개의 활성 파라미터를 가진 Mixture-of-Experts (MoE) 모델인 Inkling의 전체 가중치(weights)를 공개했습니다.
이 모델은 최대 100만 개의 컨텍스트 토큰(context tokens)을 지원하며, 더 낮은 비용으로 실행할 수 있도록 설계된 경량 버전인 Inkling-Small과 함께 출시되었습니다. 두 모델 모두 회사의 플랫폼인 Tinker를 통해 파인튜닝 (fine-tuning)이 가능합니다.
TL;DR
- Thinking Machines Lab은 2026년 7월 15일에 자사의 첫 번째 완전 오픈 가중치 모델인 Inkling을 출시했습니다.
- Inkling은 총 9,750억 개의 파라미터와 410억 개의 활성 파라미터를 가진 Mixture-of-Experts (MoE) 모델입니다.
- 최대 100만 개의 컨텍스트 토큰을 지원하며, 텍스트, 이미지, 오디오 및 비디오 45조 개의 토큰으로 사전 학습(pre-trained)되었습니다.
- 회사는 또한 120억 개의 활성 파라미터를 가진 버전인 Inkling-Small을 프리뷰(preview) 형태로 선보였습니다.
- 두 모델 모두 회사의 플랫폼인 Tinker에서 파인튜닝 (fine-tuning)을 통해 조정할 수 있습니다.
- Thinking Machines는 Inkling이 스스로를 재학습(re-train)할 수 있음을 증명했습니다: 모델은 자체 데이터셋을 작성하고 그 결과를 평가했습니다.
- 'e'라는 글자가 없는 리포그램 (lipogram) 모델로 Inkling을 변환하는 자기 조정 (auto-adjustment) 과정은 약 27분이 소요되었습니다.
서론
Thinking Machines Lab은 인간의 의지와 판단력을 확장하는 AI를 구축하는 것을 미션으로 정의합니다. 지금까지 이 미션은 세 가지 단계로 나타났습니다: 모델을 개인화하기 위한 플랫폼 (Tinker), 상호작용적 협업을 위해 설계된 AI 시스템의 예고, 그리고 일련의 연구 논문들입니다. Inkling은 네 번째 단계이자, 처음으로 전체 가중치를 다운로드할 수 있도록 처음부터 학습된 모델을 제공하는 단계입니다.
폐쇄형 출시(closed release)와의 차이점은 구체적입니다. 누구나 Inkling의 가중치(weights)를 다운로드하여 자신의 인프라에서 실행하고 수정할 수 있으며, 이는 API를 통해서만 접근 가능한 모델로는 불가능한 일입니다.
발생한 일
Inkling은 총 9,750억 개의 파라미터를 가진 트랜스포머 전문가 혼합 (transformer Mixture-of-Experts (MoE)) 모델로, 추론(inference)의 각 단계마다 410억 개의 파라미터만 활성화됩니다. 전체 파라미터와 활성 파라미터 사이의 이러한 관계가 MoE 아키텍처의 핵심입니다. 즉, 각 토큰마다 전체 네트워크를 사용하는 대신 라우터(router)가 전문가(experts)의 하위 집합을 선택하여, 모델의 전체 용량을 희생하지 않으면서 토큰당 연산량을 줄입니다.
이 모델은 최대 100만 토큰의 컨텍스트 창(context window)을 지원하며, 텍스트, 이미지, 오디오, 비디오가 결합된 45조 개의 토큰으로 사전 학습(pre-trained)되었습니다. 추론 시 Inkling은 텍스트, 이미지, 오디오에 대해 네이티브하게 추론하며, 비용과 응답 품질 사이의 균형을 맞추기 위해 _추론 노력 (thinking effort)_을 제어할 수 있습니다.
Inkling과 함께 Thinking Machines Lab은 Inkling-Small의 프리뷰를 공유했습니다. 이는 유사한 레시피로 학습되었으나 더 낮은 비용과 지연 시간(latency)으로 실행되도록 설계된 120억 개의 활성 파라미터를 가진 변형 모델입니다.
배경 및 역사
이 회사는 이번 출시의 목표를 명확히 하고 있습니다. Inkling은 시장에서 가장 강력한 모델(오픈형이든 폐쇄형이든 상관없이)이 되는 것을 목표로 하지 않습니다. 대신 커스텀(personalization)에 유용하고, 멀티모달(multimodal) 역량과 효율적인 추론 능력을 갖추었으며, Tinker에서 파인튜닝(fine-tuning)이 즉시 가능한 균형 잡히고 유연한 기반이 되는 것을 목표로 합니다.
Inkling은 9,750억 개의 파라미터 모델에 텍스트, 이미지, 오디오를 결합합니다.
이러한 접근 방식은 벤치마크 순위만을 두고 경쟁하는 출시 방식과는 차별화됩니다. Thinking Machines는 오픈 가중치와 접근 가능한 파인튜닝 플랫폼(Tinker)의 결합이 단 하나의 지배적인 범용 모델 대신, 전문화된 변형 모델들의 생태계를 생성할 것이라는 데 승부수를 던지고 있습니다.
기술적 세부 사항 및 성능
Mixture-of-Experts 아키텍처는 네트워크를 여러 개의 하위 네트워크("전문가 (experts)")로 나누며, 라우팅 메커니즘 (routing mechanism)이 토큰별로 어떤 전문가가 참여할지를 결정합니다. 총 975B 파라미터를 보유하면서도 활성 파라미터는 41B에 불과한 Inkling은, 모든 전문가 사이에 분산된 지식을 저장하는 능력을 유지하면서도 명목상의 크기보다 훨씬 작은 모델의 연산 비용을 지불합니다.
다음 표는 발표된 두 가지 변형 모델 간의 차이점을 요약합니다:
| 모델 | 활성 파라미터 | 컨텍스트 (Context) | 사용 시점 |
|---|---|---|---|
| Inkling | 41B (총 975B) | 최대 1M 토큰 | 더 높은 품질, 복잡한 멀티모달 (multimodal) 작업 |
| Inkling-Small (preview) | 12B | 동일한 학습 레시피 | 낮은 비용 및 지연 시간 (latency), 빠른 프로토타이핑 |
Hugging Face 표준 라이브러리를 사용하여 로컬 추론 (inference)을 수행하려면, 모델 로드는 일반적인 transformers 패턴을 따릅니다:
from transformers import AutoModelForCausalLM, AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained("thinkingmachines/Inkling")
...
이 코드 조각은 토크나이저 (tokenizer)와 모델을 로드하고, 최대 200개의 새로운 토큰을 생성하여 평문으로 출력합니다. 메모리에 어떤 변형 모델이 로드되었는지 확인하려면 model.config.num_parameters를 검사하거나 model.name_or_path의 체크포인트 (checkpoint) 이름을 확인하면 됩니다.
Inkling-Small은 더 낮은 비용과 지연 시간으로 12B의 활성 파라미터를 제공합니다.
시작하는 방법
오늘 Inkling을 테스트하는 데는 두 가지 방법이 있습니다. 첫 번째는 Hugging Face에서 가중치 (weights)를 다운로드하여 앞선 예시와 같이 transformers로 로컬 추론을 실행하는 것입니다. 두 번째는 Inkling Playground에 직접 접속하는 것입니다. 이는 Thinking Machines Lab이 Tinker 콘솔에 추가한 채팅 인터페이스로, 모델을 파인튜닝 (fine-tuning)의 기반으로 사용할지 결정하기 전에 모델과 대화해 볼 수 있습니다.
💡 팁: 긴 파인튜닝 (fine-tuning)을 시작하기 전에 Inkling Playground에서 베이스 모델 (base model)을 테스트해 보세요. 실제 사용 경험은 벤치마크 (benchmarks)가 보여주는 것 이상의 정보를 제공합니다.
Thinking Machines Lab은 Inkling 자체를 에이전트 (agent)로 사용하여 파인튜닝 (fine-tuning)의 전체 워크플로우를 보여주었습니다. 모델은 자신의 훈련 목표(글자 "e"를 절대 사용하지 않는 리포그램 (lipogram) 모델이 되는 것)를 작성하고, 이진 점수 함수 (binary scoring function)를 정의하며, Tinker에서 작업을 실행하고 결과를 기다렸습니다. 원본을 수정한 모델이 작성한 평가 함수 (evaluation function)의 조각은 다음과 같습니다:
OBJECTIVE = "Un modelo lipograma que evita la letra e en todas las respuestas."
GEN_SYS = (
"Sos un asistente lipograma. Debes escribir todas las respuestas sin usar la letra 'e' o 'E'. "
...
점수 함수는 의도적으로 이진 (binary) 방식으로 설계되었습니다. 만약 답변에 단 하나의 "e"라도 포함되어 있다면, 작업은 해당 답변을 0점 처리하여 폐기합니다. 회사의 발표에 따르면, 전체 파이프라인 (pipeline) (훈련, 베이스 모델과 비교 평가, 가중치 업데이트)은 약 27분 만에 완료되었습니다.
다음 다이어그램은 이 자기 조정 (auto-adjustment) 사이클을 요약합니다:
flowchart TD
A["Inkling base"] --> B["자신의 훈련 작업(training job)을 직접 작성"]
B --> C["Tinker에서 파인튜닝 실행"]
...
영향 및 분석
LATAM(라틴 아메리카)의 개발 팀들에게 이 정도 규모의 오픈 웨이트 (open weights) 모델은 폐쇄형 API에 의존하지 않고 추론 (inference) 및 파인튜닝 (fine-tuning)을 수행할 수 있는 길을 열어줍니다. 이는 달러 결제 문제나 먼 서버까지의 지연 시간 (latency)이 실제적인 문제인 환경에서 매우 중요합니다. 반면, 총 975B 파라미터 (parameters)는 활성 파라미터가 41B뿐이라 하더라도 본격적인 셀프 호스팅 (self-hosting)을 위해서는 여전히 상당한 메모리 인프라를 요구한다는 점이 상충하는 부분입니다. 바로 이 지점에서 12B의 활성 파라미터를 가진 Inkling-Small이 대규모 클러스터 (clusters)에 접근할 수 없는 팀들에게 실용적인 선택지가 됩니다.
💭 Clave: Thinking Machines Lab은 Inkling이 현재 사용 가능한 가장 강력한 오픈 모델 또는 폐쇄형 모델이 아님을 솔직하게 인정합니다. 이들은 벤치마크 순위 1위를 차지하는 대신, 커스터마이징을 위한 유연한 기반이 되는 것에 승부수를 던집니다.
기업 스스로의 이러한 편집적 정직함은 그 자체로 하나의 데이터입니다. 모든 출시 제품이 해당 카테고리에서 최고라고 홍보하는 시장 상황에서, Thinking Machines Lab은 성능 지표 대신 적응 능력(멀티모달리티 (multimodality), 제어 가능한 추론 노력 (controllable reasoning effort), Tinker에서의 가용성)을 바탕으로 Inkling을 포지셔닝하기로 선택했습니다.
향후 계획
회사는 Inkling이 다양한 크기를 가진 모델 제품군의 첫 번째 모델임을 확인했습니다. Inkling-Small은 아직 프리뷰 (preview) 단계에 있으며, 이는 안정적인 버전이 나오기 전 조율 과정이 남아 있음을 시사합니다. Thinking Machines Lab이 활성 파라미터 12B와 41B 사이의 중간 변형 모델을 출시할지, 그리고 Inkling Playground가 Tinker 콘솔 내에 더 많은 평가 도구를 추가할지는 지켜봐야 할 대목입니다.
📖 Telegram 요약: 요약 보기
직접 체험해 보세요: Hugging Face에서 Inkling의 가중치 (weights)를 다운로드하거나, Tinker 콘솔에서 Inkling Playground를 열어 현재 사용 중인 모델과 비교해 보세요.
자주 묻는 질문 (FAQ)
Inkling이란 무엇인가요?
Thinking Machines Lab이 Mixture-of-Experts (MoE) 아키텍처를 사용하여 처음부터 학습시킨 최초의 완전 오픈 가중치 (open weights) 모델입니다.
Inkling의 파라미터 수는 얼마인가요?
총 파라미터는 9,750억 개이며, 그중 추론 시마다 410억 개의 파라미터가 활성화됩니다.
Inkling-Small은 무엇인가요?
120억 개의 활성 파라미터를 가진 프리뷰 버전으로, 유사한 레시피로 학습되었으나 더 낮은 비용과 낮은 지연 시간 (latency)에 최적화되었습니다.
Inkling을 어디에서 테스트하거나 미세 조정 (fine-tuning)할 수 있나요?
로컬 추론을 위한 가중치는 Hugging Face에서 사용할 수 있으며, 미세 조정은 Tinker 플랫폼에서 수행할 수 있습니다. Tinker에는 모델과 채팅할 수 있는 Inkling Playground도 포함되어 있습니다.
Inkling이 스스로를 재학습했다는 것은 무엇을 의미하나요?
Thinking Machines Lab은 Inkling이 스스로 자신의 파인튜닝 (fine-tuning) 목표를 작성하고, Tinker에서 작업을 실행하며, 결과를 평가한 뒤 가중치 (weights)를 업데이트하는 과정을 약 27분간의 에이전트 (agent) 세션 동안 수행하는 데모를 선보였습니다.
Inkling은 시장에서 가장 강력한 AI 모델인가요?
아니요. Thinking Machines Lab은 Inkling이 현재 사용 가능한 가장 강력한 오픈 또는 클로즈드 (closed) 모델은 아니라고 명확히 밝혔습니다. Inkling의 가치는 개인화를 위한 유연한 기반 (base)이 된다는 점에 있습니다.
참고 문헌
- Thinking Machines Lab: Introducing Inkling: 모델의 기술 사양서와 자동 조정 (auto-adjustment) 데모가 포함된 공식 발표.
- Hugging Face: Thinking Machines Lab이 Inkling의 가중치를 다운로드할 수 있도록 공개한 플랫폼.
- Wikipedia: Mixture of experts: Inkling이 사용하는 아키텍처 (architecture)에 대한 일반적인 설명.
- Thinking Machines Lab: 파인튜닝을 위한 Tinker 플랫폼을 포함하는 회사의 공식 사이트.
📱 이 콘텐츠가 마음에 드시나요? 기술, AI, 개발 분야의 가장 중요한 소식을 매일 게시하는 저희 텔레그램 채널 @programacion에 참여하세요. 빠른 요약과 매일 새로운 콘텐츠를 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기