
무료 신경망, 하지만 가정용 PC용은 아니다. Inkling은 거의 1조 개의 파라미터를 보유하고 있다
요약
Thinking Machines가 9,750억 개의 파라미터를 가진 MoE 모델 Inkling의 전체 가중치를 공개했습니다. 410억 개의 활성 파라미터를 사용하지만, 거대한 전체 규모로 인해 가정용 PC보다는 전문적인 인프라가 필요합니다.
핵심 포인트
- Inkling은 9,750억 개의 전체 파라미터와 410억 개의 활성 파라미터를 가진 MoE 모델임
- 텍스트, 이미지, 오디오를 지원하며 최대 100만 토큰의 컨텍스트를 제공함
- 가중치는 무료로 공개되었으나 실행을 위한 GPU 및 운영 비용은 별도로 발생함
- 범용 정답 모델보다는 커스터마이징을 위한 거대한 베이스 모델로 포지셔닝됨
7월 15일, Thinking Machines는 Inkling의 전체 가중치 (weights)를 공개했습니다. 이 소식은 Hacker News에서 빠르게 1,223점의 점수와 293개의 댓글을 모았으며, r/LocalLLaMA에서의 토론은 1,298개의 추천을 받았습니다. 공식은 거의 완벽하게 들립니다. 신경망을 무료로 사용할 수 있고, 가중치 (weights)를 이용할 수 있으며, 자신의 작업에 맞춰 미세 조정 (fine-tuning)할 수 있다는 것입니다.
하지만 이 공식에는 다운로드 버튼에서는 보이지 않는 대가가 있습니다. Inkling은 총 9,750억 개의 파라미터 (parameters)를 포함하고 있지만, 요청을 처리할 때는 410억 개의 파라미터만을 활성화합니다. 이것이 자동으로 가정용 PC에서 실행할 수 있는 후보가 된다는 뜻은 아닙니다. 가중치는 무료일 수 있지만, GPU, 전기, 호스팅, 엔지니어의 시간 및 운영 비용은 별도의 예산 항목으로 남습니다.
실질적인 주요 결론은 다음과 같습니다. 선택은 '유료' 신경망과 '무료' 신경망 사이에서 하는 것이 아니라, 원하는 결과를 얻기 위한 세 가지 방법 사이에서 해야 합니다.
정확히 무엇을 출시했는가
Inkling은 전문가 혼합 (Mixture of Experts, MoE) 방식으로 구축되었습니다. 이러한 아키텍처 (architecture)에서는 특정 요청에 대해 모든 파라미터가 작동하지 않습니다. 따라서 410억 개의 활성 파라미터 (active parameters) 수치는 요청당 계산에 중요하며, 9,750억 개의 전체 파라미터 (total parameters) 수치는 저장, 로드 및 가중치 작업의 전반적인 복잡성에 중요합니다.
이 모델은 텍스트, 이미지, 오디오를 네이티브로 수용하며 최대 100만 토큰의 컨텍스트 (context)를 지원합니다. 그러면서도 Thinking Machines 자체는 Inkling을 절대적으로 가장 강력한 모델이라고 부르지는 않습니다. 이 릴리스는 이를 커스터마이징 (customization)을 위한 기반으로 포지셔닝합니다. 이는 중요한 유보 조항입니다. 우리 앞에 있는 것은 모든 요청에 대한 보편적인 정답이 아니라, 이를 중심으로 자신만의 프로세스를 구축할 준비가 된 사람들을 위한 거대한 베이스 (base)입니다.
그렇기 때문에 커뮤니티의 관심이 이해됩니다. 전체 가중치를 통해 모델의 동작을 조사하고, 실행 방식을 선택하며, 모델을 적응시키고, 폐쇄적인 인터페이스에만 의존하지 않을 수 있는 가능성이 열리기 때문입니다. 하지만 이것이 작업의 엔지니어링 측면을 없애주는 것은 아닙니다.
"무료"는 세 가지 서로 다른 의미를 갖는다
검색에서 "무료 신경망" 또는 "무료 온라인 신경망"과 같은 쿼리가 나타날 때, 여기에는 서로 다른 기대치가 섞여 있을 수 있습니다.
| 무엇을 사용할 수 있는가 | 무엇을 제공하는가 | 무엇을 약속하지 않는가 |
|---|---|---|
| 전체 가중치 (Full weights) | 모델을 독립적으로 실행하고 적응시킬 수 있는 능력 | 무료 컴퓨팅 자원 및 완성된 웹 인터페이스 |
| ... |
Inkling은 첫 번째 경우, 즉 전체 가중치 (Full weights)가 공개된 경우에 해당합니다. 코드와 데이터의 가용성을 별도로 확인하지 않고 이를 "오픈 소스 (open source)"라고 부르는 것은 부정확할 것입니다. 또한 브라우저에서 무료로 사진을 생성해 주는 신경망이라고 약속할 수도 없습니다. 네이티브 이미지 입력 기능이 사진 생성이나 처리를 위한 완성된 무료 서비스와 동일한 것은 아니기 때문입니다.
410억 개의 활성 파라미터가 문제를 해결하지 못하는 이유
41B의 활성 파라미터 (active parameters)를 보고, 실행 시 일반적인 해당 규모의 모델과 비슷할 것이라고 결론 내리기는 쉽습니다. 하지만 바로 이 지점에서 초기 인식이 달라집니다.
활성 파라미터는 요청(query) 시 모델의 라우팅되는 부분의 연산 부하를 설명합니다. 그러나 시스템이 답변을 시작하기 전에 전체 가중치 (full weights)에 접근할 수 있어야 합니다. 그 후에는 정밀도 (precision) 및 양자화 (quantization)의 선택, 컨텍스트 (context)를 위한 메모리, 요청 처리 방식, 오류 모니터링 및 환경 업데이트 등의 문제가 발생합니다.
Inkling은 Transformers, SGLang, vLLM, llama.cpp, Unsloth를 통한 실행 옵션을 제공합니다. GGUF 및 MLX 형식의 파생된 양자화 빌드 (quantized builds)도 빠르게 등장했습니다. 이는 실험의 범위를 넓혀주지만, "메모리가 얼마나 필요한가"에 대한 단 하나의 정직한 수치를 제공하지는 않습니다. 구성은 정밀도, 양자화 및 특정 시나리오에 따라 달라지며, 메모리와 품질에 대한 주장은 각 빌드 제작자의 모델 카드 (model card)를 통해 확인해야 합니다.
즉, 양자화 (quantization)는 실험을 더 현실적으로 만들 수 있지만, 비교 대상 자체를 변화시킵니다. 포팅(port)된 모델이 귀하의 작업 흐름에서 원본 모델의 품질, 안전성 및 동작을 그대로 유지할 것이라고 미리 가정해서는 안 됩니다.

로컬 실행이 정당화되는 경우
로컬 실행이 정당화되는 경우
open weights 지지자들의 가장 강력한 주장은 타당합니다. 만약 작업이 반복되고, 깊은 적응(deep adaptation)을 요구하며, 팀이 인프라를 유지할 능력이 있다면, 실행 통제권(control over the launch)은 단순함보다 더 가치 있을 수 있습니다. Inkling은 맞춤화에 직접적으로 설계되었으며, Thinking Machines는 Tinker를 통해 셀프 파인튜닝(self-fine-tuning)을 보여줍니다.
하지만 이것은 제조사의 시연일 뿐, 모든 회사나 데이터셋 또는 메트릭에 성공적인 학습이 보장된다는 의미는 아닙니다. 파인튜닝을 시작하기 전에 두 가지 가설을 분리하여 고려해야 합니다:
- 기본 모델이 이미 작업을 해결하며, 필요한 것은 추론(inference) 접근 방식일 뿐이다.
- 품질 문제가 프롬프트나 라우팅 또는 더 적합한 모델로는 얻을 수 없는 '적응' 자체에 달려 있다.
두 번째 경우라면 데이터 준비 비용, 결과 평가 및 반복 실행이 해결책의 일부가 됩니다. 첫 번째 경우라면 단 하나의 실험을 위해 인프라를 구매하거나 임대하는 것은 종종 단순한 필요성—즉, 실제 요청에 대한 답변을 빠르고 정직하게 비교할 수 있는 것—을 가리는 경우가 많습니다.
마법 없는 선택표
| 옵션 | 다음 경우에 선택 | 다음 경우에 선택하지 않음 |
|---|---|---|
| 로컬 open-weight 실행 | 반복적인 작업을 위한 관리 가능한 환경이 필요하고 이를 유지할 역량이 있을 때 | 목표가 단발성 가설 검증일 경우 또는 팀이 포트(ports)의 품질을 측정할 준비가 안 되었을 때 |
| ... |
이로써 "무료 신경망"이 연구를 위한 훌륭한 출발점은 될 수 있지만, 서비스를 위한 비용 산정(estimate)으로는 부적절할 수 있다는 점이 명확해졌습니다. 첫 번째 검증을 위해서는 Inkling이 이미 카탈로그에 있다고 가정하지 말고, 실제 사용량에 따른 추론 (inference) 비용을 provod.ai의 로컬 시나리오와 비교해 보는 것이 유용합니다. 추상적인 파라미터가 아니라 동일한 워크로드 (workload)를 비교해야 합니다.
Inkling의 역설은 오픈 웨이트 (open weights)가 실질적인 실행을 위한 인프라 요구 사항을 무효화하지 않는다는 점에 있습니다. 모델을 다운로드하고 수정할 수 있다는 능력이, 선택한 구성에서 원하는 결과가 나올 것임을 의미하지는 않습니다.
실무 지침
다음 세 가지 질문에 대한 답을 얻기 전까지는 하드웨어를 구매하지 마십시오:
- 모델이 현재 버전보다 더 잘 처리해야 하는 구체적인 요청(query)은 무엇인가?
- 가정(assumption)이 아닌, 어떤 빌드(build)와 정밀도(precision)를 검증할 것인가?
- 실행, 테스트, 모니터링 및 유지보수를 포함한 전체 사이클의 비용은 얼마인가?
만약 어떤 질문에 대해서도 아직 답이 없다면, 적은 규모에서 결과를 측정하는 것부터 시작하십시오. 답이 준비되어 있고 커스터마이징 (customization)이 실제로 비즈니스 과제에 영향을 미친다면, 오픈 웨이트 (open weights)는 마케팅 용어가 아닌 실질적인 작업 도구가 됩니다.

provod.ai — 개인 및 기업용 시나리오를 위한 러시아 AI API 라우터
단일 API와 웹 인터페이스가 익숙한 AI 생태계를 통합합니다: 채팅의 첫 번째 요청부터 에이전트 시스템 (agentic systems), 멀티미디어, 그리고 비즈니스를 위한 프로덕션 통합 (production integrations)까지 지원합니다.
하나의 카탈로그에 담긴 텍스트 및 미디어용 최신 모델들: 텍스트용으로는 OpenAI의 GPT, Anthropic의 Claude, Google의 Gemini, xAI의 Grok, DeepSeek, Qwen, GLM, Kimi 및 MiniMax가 있으며, 이미지용으로는 Nano Banana 2 Pro 및 GPT Image가, 비디오용으로는 Seedance, Kling, Veo 및 Google Omni의 최신 버전이 준비되어 있습니다. 또한 추론 (reasoning), 검색 (search), 문서 (documents), 임베딩 (embeddings), 음악 및 오디오를 위한 모델들도 이용 가능합니다.
플랫폼의 가격 구조 — 자체 마진 없는 공식 요금제: 제공업체와 1:1 비율로 적용되며, 루블화 결제, 통합 잔액 관리 및 비즈니스용 서류 지원을 제공합니다. 이는 러시아에서 전 세계 AI 카탈로그를 결제할 수 있는 가장 직접적이고 저렴한 방법 중 하나입니다.
provod.ai에 연결하세요: 등록 양식 · 모델 가격 · 152-FZ에 따른 데이터 보호 · provod.ai 메인 페이지
반복적인 작업을 위해 당신은 무엇을 선택하시겠습니까: API를 통해 검증된 답변마다 비용을 지불하시겠습니까, 아니면 제어와 커스텀 (customization)을 위해 자체적인 오픈 웨이트 (open-weight) 루프에 투자하시겠습니까?
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기