Microsoft-Decision-1, 빠른 의사결정을 위한 Microsoft의 모델
요약
본 기사는 소형 모델을 활용한 의사결정(Decision) 작업의 중요성을 강조하며, Qwen이나 Gemma 같은 경량화된 모델들이 큰 성능을 보여주고 있음을 분석합니다. 특히 BF16과 같은 데이터 타입이 양자화보다 정확도에 유리하다는 실질적인 개발 교훈을 제시하고 있습니다.
핵심 포인트
- 소형 모델 기반의 의사결정 작업(Decision) 능력이 중요해지고 있음.
- BF16 등 비양자화 방식이 의사결정 정확도를 높이는 데 효과적임.
- Microsoft와 Apple 모두 로컬 추론 환경 구축에 집중하고 있는 추세임.
- 오픈 웨이트(Open Weight)라는 용어의 정의 및 실무 적용에 대한 논의가 있음.
Cloudflare의 Clef, Strands decider를 비롯해 최근 몇 주간 나온 수많은 모델처럼, 이것도 소형 Qwen 모델을 기반으로 함. 다들 이걸로 이렇게 큰 관심을 끌어내는 게 재미있지만, Qwen은 정말 작은 몸집으로 큰일을 해내고 있음. 오픈 소스까지는 아니더라도 공개 가중치가 생태계 전체를 움직이는 모습은 반가움.
지난해 인수된 스타트업 Pi Labs의 지식재산도 모델을 빠르게 최고 수준의 성능으로 끌어올리는 데 많이 활용됨. 이 회사는 Jev 출시 훨씬 전부터 점수 산정 모델을 만들고 있었음.
직접 실험하며 얻은 가장 큰 교훈은 의사결정 작업에서 비양자화 BF16 Qwen이 크기가 두 배인 Q8 모델보다 낫다는 것임. Kev가 원래의 8B에서 4B BF16으로 옮긴 이유도 이것일 듯함. 양자화가 의사결정 정확도를 흐트러뜨리는 듯하다는 게 흥미롭지 않나요?
오늘 오후부터 Gemma4 기반 strands-decider도 2B, 4B, 12B, 26B로 제공함. https://huggingface.co/StrandsAgents.
이 모델 계열을 이끄는 Fabio가 동의할지는 모르겠지만, 처음부터 다시 한다면 Qwen3.5보다는 Gemma4를 기반으로 삼을 듯함. 그래도 Qwen 기반 경쟁 모델이 많이 나오는 건 놀랍지 않고, 작업 결과가 공개되는 건 확실히 반가움.
이런 개별 용도 모델을 Microsoft Phi로 만들지 않는 게 의외임. 의도적으로 작게 만든 모델이긴 하지만, Microsoft가 기능을 더 갖춘 조금 큰 Phi를 만들지 못할 이유도 없음.
오픈 소스가 아니라 반드시 오픈 웨이트라고 불러야 한다는 고집은 점점 우스워짐. 실무에서는 별로 신경 쓰지 않는 구분이고, 사실관계도 틀렸다고 봄. 언어 모델에서는 가중치가 소스임. Apache는 소스를 “수정을 위해 선호되는 형태”로 정의하며, 모델 제작자까지 모두 가중치를 그 형태로 사용함. 모델은 초기화할 때 생성되고, 이후 가중치를 수정하며 학습됨.
이 모델들은 모두 오픈 소스임. Qwen 등이 공개하지 않는 건 학습 코드이므로, 오픈 소스 모델이지만 학습 코드는 비공개라고 하면 됨. Apertus와 Olmo는 모델·학습 코드·데이터셋을 모두 공개하고, Nemotron은 모델과 학습 코드, 일부 데이터셋만 공개하는데 그것도 괜찮음.
자기회귀 완성 모델을 의사결정 모델로 수정해 재배포하는 모습 자체가 충분한 증거임. 라이선스가 주는 권리는 모델을 살펴보고, 실행하고, 수정하고, 재배포할 권리이며, 원래 그 이상의 권리를 주는 것도 아님. 굳이 오픈 웨이트라는 이름을 고집하는 건 우스움.
Microsoft는 로컬 추론에 크게 힘을 싣는 듯함. Windows에 로컬로 실행되고 필요하면 클라우드나 엣지에서도 실행되는 네이티브 AI API가 들어가는 미래를 보는 것 같음.
내 Copilot+ PC가 드디어 실제로 쓸모 있는 로컬 추론을 해주면 좋겠음. Advanced Paste용 Phi Silica는 조금 늦었지만 좋은 출발이었음. 제대로만 한다면 Microsoft-Decision-1도 로컬에서 가능성이 있어 보이지만, 지금까지의 실적 때문에 조심스럽긴 함.
Apple도 같은 방향으로 가고 있음. 실제 구현 작업을 하는 모델이 꼭 opus 4.6보다 뛰어날 필요는 없음. 이를 로컬에서 실행할 하드웨어는 이미 존재하고, 몇 년 뒤면 2026년 달러 가치 기준 2,000달러 아래로 내려갈 가능성이 큼.
MAI-Image-2.6은 정말 탄탄한 이미지 모델임. Microsoft 모델이 이만큼 좋아지고 있다는 게 놀라웠고, 꽤 잘하고 있음.
최근 10년 넘게 쌓인 Samsung Health 데이터를 로컬 모델로 분석했음. 이해하지도 못하고 굳이 이해하고 싶지도 않은 생소한 스키마의 CSV·JSON 파일이 수천 개였는데, 첫 시도에 스키마를 추론하고 그동안 얼마나 발전했는지, 혹은 제자리였는지 요약해 줌. 나중에 데이터를 더 내보낼 때 실행할 스크립트도 얻었음.
아래 글과 정확히 같은 하드웨어에서 Qwen3.6-35B-A3B-OptiQ-4bit를 사용함. 앞으로 어디로 향할지는 어렵지 않게 내다볼 수 있음. https://lws.io/blog/my-local-model-setup/
디코더 모델로 분류기를 만드는 이유를 잘 모르겠음. Jev는 요청한 각 분류나 선택지에 확률 점수를 주며, 이는 해당 선택이 맞을 실제 통계적 확률임.
디코더 모델을 쓰면 각 분류에 대응하는 다음 토큰의 확률을 바탕으로 가장 가능성 높은 분류를 고르게 됨. 둘 다 확률이지만 의미는 완전히 다른 것 아닌가요?
Microsoft가 Qwen을 기반 모델로 쓴다고 밝힌 내용은 나도 못 봤음. 여기 댓글을 보고 그렇게 생각했던 듯함. 어쨌든 위 질문은 디코더 모델 기반의 다른 의사결정 모델들에 관한 것임.
내 소규모 시험에서는 비용이 Jev의 0.72배였지만 지연 시간은 더 길었음. p50 기준 Jev가 283ms, 이 모델이 369ms였음. 측정한 모든 시나리오에서 결과는 상당히 비슷했고, 이 계열에서 내가 시험한 것 중 상용 출시의 존재 이유를 입증한 첫 모델임.
Qwen 튜닝 모델들도 좋지만, 지금까지 시험한 것들은 저렴하게 직접 호스팅하고 추가 미세조정까지 할 수 있지 않으면 가격이나 성능 때문에 실용적이지 않았음.
글에서는 의사결정 모델을 코드에서 쓰는 방법을 다루는데, 일상의 결정을 어려워하는 사람에게도 도움이 될까요? 주변에 그런 도움이 절실한 사람이 몇 명 있음.
LLM은 이미 그런 일을 하며, 한쪽 선택을 다른 쪽보다 권하는 이유를 그럴듯하게 설명해 줄 수 있다는 장점도 있음. 결정 근거를 알 수 없는 모델 출력을 그대로 따르려면 상당한 신뢰가 필요해 보임.
또 하나의 가격 경쟁력 없는 Jev 경쟁 제품처럼 보임. Microsoft는 GPT Terra나 GPT Luna가 아니라 GPT Sol하고만 가격을 비교함. OpenAI의 Jev 유사 제품은 Luna 기반이고, Jev는 그 Luna 비용의 40%인데 Jev와의 비교도 없음.
신제품 하나가 이렇게 빨리 많은 경쟁자를 만들어낸 적이 있었나 싶음. 모두 뒤늦게 뻔해 보이는 거대한 시장을 깨닫고 서둘러 한몫 차지하려는 건 분명함. 하지만 아직 Jev 가격에 근접한 제품은 보이지 않음.
중국의 공개 가중치 모델들이 더 싼 모델을 내놓을지 지켜볼 만함. DeepSeek는 알고리즘 트레이딩 쪽에서 출발했으니, 내부적으로 쓰는 작고 빠른 의사결정 모델이 이미 있을 법함.
Microsoft-Decision-1은 Qwen3.5-9B를 사후 학습해 한 번의 처리로 빠르게 의사결정 점수를 산출하도록 만들었고, 곧 Microsoft AI(MAI)와 OpenAI를 포함한 다른 모델로 기반을 바꿀 예정이라고 함. 이제 중국 모델에 대한 두려움이 드디어 가라앉는 듯함.
안타깝지만 선택지가 별로 없음. 덜 알려진 몇 가지를 빼면 중국 모델 아니면 Gemma나 Llama 정도 아닌가요?
아직 API 문서가 안 보이는데 실제로 어떻게 써볼 수 있나요? 관심을 끌려고 서둘러 출시한 건가요?
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기