MiMo-V2.5 실습: 15B 활성 파라미터, 네이티브 멀티모달 입력 및 Pro가 실제로 가치가 있는 경우
요약
Xiaomi의 MiMo-V2.5는 총 310B 파라미터에 활성 파라미터 15B를 가진 희소 MoE 모델입니다. 이 모델은 멀티모달 우선(multimodal-first) 표준 버전과 텍스트 전용 Pro 버전을 제공하며, 각 버전의 최적 사용처가 다릅니다. 특히 SWA 레이어와 글로벌 레이어를 결합하여 KV-캐시를 크게 줄여 1M 컨텍스트 처리를 가능하게 했습니다.
핵심 포인트
- MiMo-V2.5는 총 310B 파라미터, 활성 파라미터 15B의 희소 MoE 구조입니다.
- SWA와 글로벌 레이어 조합으로 KV-캐시를 줄여 1M 컨텍스트 처리가 가능합니다.
- 표준 버전은 멀티모달에 강하고 저렴하며, Pro는 텍스트 전용 고성능 모델입니다.
- 코딩 및 에이전트 성능을 평가할 때는 Terminal-Bench와 SWE-Bench Pro 점수를 주목해야 합니다.
저는 한동안 Xiaomi의 MiMo-V2.5를 코딩 및 문서 분석 작업에 사용해 왔는데, 흥미로운 점은 벤치마크 시트 자체가 아니라 표준 모델과 Pro 모델이 근본적으로 다른 작업을 위해 최적화되어 있다는 것입니다. 표준 버전은 멀티모달 우선(multimodal-first)이며 토큰당 비용이 저렴합니다. 반면 Pro는 텍스트 전용(text-only)이고, 트릴리언 파라미터 규모이며 Xiaomi가 공개한 요율로 볼 때 약 3.1배 비쌉니다. 둘 중 무엇을 선택할지는 품질의 문제가 아니라 라우팅 결정 문제입니다.
만약 이 모델들 중 하나를 프로덕션 환경에 연결하려 한다면 실제로 중요한 것은 다음과 같습니다.
아키텍처: 310B/15B가 제공하는 것
MiMo-V2.5는 총 파라미터가 310B이고 토큰당 활성 파라미터(active params)가 약 15B인 희소 MoE(sparse MoE) 모델입니다. 라우터는 토큰당 256개의 전문가 중 8개를 선택하므로, 전체 컴퓨팅 비용을 지불하지 않으면서도 일반적인 15B 밀집(dense) 모델보다 훨씬 큰 파라미터 풀에 접근할 수 있습니다.
하지만 이것이 자체 호스팅(self-hosting) 비용이 저렴하다는 것을 의미하지는 않습니다. 여전히 모든 310B 가중치(weights)를 저장하고 서비스해야 하며, 전문가 라우팅과 상호 연결 대역폭(interconnect bandwidth)이 실제 제약 조건이 됩니다. 활성 파라미터는 메모리 수치가 아니라 컴퓨팅 수치입니다.
백본은 48개 레이어로 구성되어 있습니다: 밀집 레이어 1개와 MoE 레이어 47개로 이루어져 있습니다. 어텐션(Attention)은 슬라이딩 윈도우(sliding-window) 레이어와 글로벌(global) 레이어를 5:1 비율로 번갈아 사용합니다. 구체적으로는 128 토큰 창을 가진 SWA 레이어 39개와 글로벌 레이어 9개입니다. Xiaomi에 따르면, 이는 모든 것이 글로벌한 설계 대비 거의 6배의 KV-캐시(KV-cache) 감소를 보고합니다. 이것이 1M 컨텍스트를 저렴하게 만드는 메커니즘이며, 보너스가 아닙니다.
인지(perception) 측면에는 이미지/비디오용 729M ViT (28개 레이어)와 오디오용 261M 트랜스포머 (24개 레이어)가 있으며, 이 두 가지 모두 언어 백본에 투영됩니다. 세 개의 다중 토큰 예측 모듈(Multi-Token Prediction modules, 결합 약 329M 파라미터)은 추측 디코딩(speculative decoding)과 RL 효율성을 지원합니다. 학습은 약 48T 토큰으로 진행되었으며, 포스트 트레이닝(post-training) 단계에서 컨텍스트가 점진적으로 1M까지 확장되었습니다.
가중치는 MIT 라이선스이며, 공개 베타는 2026년 4월 23일자입니다.
사양서 (Spec sheet)
| 항목 | 값 |
|---|---|
| 총 / 활성 파라미터 | 310B / 15B |
| ... | |
| 제한 속도(Rate limits)는 제공업체 수준이며, 경로 및 계정 등급에 따라 다릅니다. |
벤치마크: 도구 사용이 강력한 신호
이는 출판사에서 보고한 수치이므로 참고용으로만 활용해 주십시오. 여기에 제시된 어떤 것도 귀하의 저장소나 미디어 형식에서의 동작을 보장하지 않습니다.
코딩 및 에이전트
| 벤치마크 | 점수 |
|---|---|
| MiMo Coding Bench | 71.8 |
| ... |
The Terminal-Bench 2.0의 65.8점은 터미널 기반 에이전트에게 가장 가중치를 두어야 할 수치이며, SWE-Bench Pro의 56.1점은 단순 자동 완성을 넘어선 실제 저장소 수준의 능력을 시사합니다. ResearchClawBench의 16.91점은 예외적인 수치입니다. 만약 귀하의 작업 부하가 증거 수집 및 인용이라면, 해당 경로를 별도로 테스트해야 합니다. 왜냐하면 이 모델이 그 부분에 명확하게 강점을 보이지 않기 때문입니다.
멀티모달
| 벤치마크 | 점수 |
|---|---|
| CharXiv RQ | 81.0 |
| ... |
문서 및 고해상도 이미지 이해는 명확한 강점입니다. Claw-Eval Multimodal의 23.8점에 비해 OmniDocBench의 87.2점은 중요한 격차를 보여줍니다. 미디어를 인식하고 이를 도구를 통해 _행동_하는 것은 다른 역량이며, 후자는 실제 스택에서 엔드투엔드(end-to-end) 테스트가 필요합니다.
표준 대 Pro
| MiMo-V2.5 | MiMo-V2.5-Pro | |
|---|---|---|
| 총 파라미터 수 (Total params) | 310B | 1.02T |
| ... |
Pro는 SWE-Bench Pro에서 1.1점, Terminal-Bench 2.0에서 2.6점으로 앞서나갑니다. 이는 두 모델이 공유하는 유일한 테스트에서 나온 비교적 작은 격차입니다. Pro는 여기에 도달하기 위해 활성 파라미터(active parameters)를 약 2.8배 더 사용하며, 멀티모달 입력을 완전히 포기합니다. 만약 미디어가 귀하에게 일급 시민 입력(first-class input)이라면, Pro는 아예 고려 대상이 아닙니다.
두 모델 카드 모두 컨텍스트 길이로 1M을 명시하고 있으며 Xiaomi의 API 페이지에서는 최대 출력 길이를 128K로 명시하지만, 실제 사용 가능한 한계는 엔드포인트, 계정 및 요청 형식에 따라 다릅니다.
가격 책정(Pricing)
Per MTok
Standard (공식)
Pro (공식)
| --- | --- | ---
| Input, cache miss | $0.14 | $0.435 |
| ... |
Pro는 캐시되지 않은 입력과 출력 모두에서 standard 대비 약 3.1배 비쌉니다. 여러 공급업체에 걸쳐 라우팅하고 하나의 키와 하나의 기본 URL을 원한다면, CometAPI가 공식 캐시되지 않은 쌍보다 각각 20% 낮은 가격으로 두 가지를 나열합니다($0.112/$0.224 standard, $0.348/$0.696 Pro). 변형 간의 상대적인 격차는 동일하므로 라우팅 계산에는 영향을 주지 않고 절대 비용만 변경됩니다.
토큰당 가격이 완료된 작업에 대한 비용은 아닙니다. 도구 재시도, 컨텍스트 비대화(context bloat), 출력 길이, 실패한 실행 복구가 실제 지출을 좌우합니다. 기본값을 선택하기 전에 자체 워크로드를 샘플링해 보세요.
호출 방법 (Calling it)
별거 없습니다. 표준 OpenAI 호환 클라이언트만 사용하면 됩니다:
import os
from openai import OpenAI
...
배포하기 전에 라이브 엔드포인트와 요청 스키마를 확인하세요. 서드파티 게이트웨이에 있는 모델 ID는 업스트림 플랫폼과 독립적으로 움직일 수 있습니다.
사용 추천 시나리오 (Where I'd put it)
적합한 경우:
- 스크린샷, 문서, 비디오, 오디오 및 도구 호출을 혼합하는 멀티모달 에이전트;
- 리포지토리(repo), 계약서, 로그 및 지원 이력에 대한 장문 분석;
- 미디어 요약 및 차트 해석;
- 코딩 및 터미널 에이전트;
- 희소 활성화(sparse activation)와 낮은 토큰 가격 모두 중요한 고용량 자동화.
부적합한 경우:
- 이미지, 오디오 또는 비디오 _생성_을 요구하는 모든 작업 — 출력은 텍스트만 가능합니다. 또한, 1M 컨텍스트 상한선은 용량이므로 창 전체에 걸친 균일한 검색 정확도를 의미하지는 않습니다.
라우팅 테이블 (Routing table)
| 신호 | 시작 시 | 전환할 때 |
|---|---|---|
| 이미지/비디오/오디오가 1급 입력인 경우 | Standard | 멀티모달 전처리가 허용될 때만 |
| ... | ||
| 기본적으로 standard를 사용하고, 하드한 텍스트 우선 코딩 및 장기 에이전트 작업에만 Pro를 라우팅하세요. |
폐기 임박 (The deprecation clock)
Xiaomi는 공식 mimo-v2.5 및 mimo-v2.5-pro API 모델명이 2026년 10월 21일 베이징 시간 기준 오전 10시에 사용 중단(deprecated)되며, 자동 대체가 없을 것이라고 발표했습니다 (사용 중단 공지). 이는 Xiaomi 자체 플랫폼에 적용되므로 게이트웨이는 별도로 확인해야 합니다. 해당 ID를 기반으로 중요한 기능을 구현하기 전에 마이그레이션 계획을 세우고 라이브 경로를 반드시 확인하십시오.
빠른 답변 (Quick answers)
오픈 소스 여부? 예, MIT — 상업적 사용, 수정, 파인튜닝(fine-tuning), 재배포가 가능합니다.
파라미터 수? 총 310B, 토큰당 활성 파라미터는 15B입니다.
멀티모달 입력? 표준: 텍스트, 이미지, 비디오, 오디오 → 텍스트. Pro의 공식 사양은 텍스트 입력을 명시하고 있습니다.
컨텍스트 길이? 두 모델 카드 모두 최대 1M까지 가능하지만, Xiaomi의 현재 API 페이지에서는 둘 다 최대 128K 출력을 나열하고 있습니다. 배포된 경로를 확인하십시오.
코딩 에이전트? Pro가 더 높은 공유 벤치마크 점수를 보고하지만, 그 차이는 미미합니다 — 사용자의 레포지토리에서 테스트하여 작업 완료율, 지연 시간(latency), 총 비용을 비교해 보십시오.
멀티모달 에이전트? 표준 모델은 의심할 여지 없이 멀티모달을 지원하지만, Pro는 텍스트 전용입니다.
원래 발행처: cometapi.com
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기