MiMo-v2.6-Pro: 지능, 성능 및 가격 분석
요약
글쓴이는 OpenAI 모델의 성능 저하와 높은 비용 문제점을 지적하며, 중국 기반의 다양한 LLM(MiMo, DeepSeek, GLM 등)으로 주력 사용처를 옮기고 있다. 특히 DeepSeek은 캐시 적중률이 높아 대규모 코드 분석에 효율적이며, 로컬 환경에서는 Qwen 시리즈를 활용하고 있다.
핵심 포인트
- OpenAI 모델의 성능 저하와 높은 비용 문제점을 체감함.
- MiMo, DeepSeek 등 중국 LLM들이 만족스러운 성능과 가성비를 제공함.
- DeepSeek은 캐시 적중률이 높아 대규모 코드 분석에 유리함.
- 로컬 환경에서는 Qwen 시리즈를 활용하며 M5 Mac의 텐서 코어 개선을 기대함.
OpenAI 사용 한도가 크게 줄었고 지능도 눈에 띄게 떨어지는 듯해서, 이제 중국 모델을 진지하게 써보려 함. 시간이 더 걸려도 괜찮으니, 매일 예측 가능한 수준으로 작동하기만 하면 됨.
월 200달러짜리 Codex를 쓰는데, 예전에는 주간 한도로 일주일을 일할 수 있었지만 이제는 대략 1~2일이면 소진됨. Astra는 아예 쓰지 않고 Sol이 Luna Xhigh를 조율하도록 쓰는데도 일주일 할당량에 한참 못 미침.
새 모델 출시가 다가올 때마다 기존 모델이 크게 멍청해지는 듯함. 증거도 없고 입증할 수도 없지만, 돈을 어디에 쓸지는 바꿀 수 있음.
200달러 구독으로 쓰던 Sol 5.6 xhigh는 코딩 작업에서 매우 믿음직했음. 그런데 이번 주에는 시스템을 손봤는지, 주간 한도에 전혀 근접하지 않았는데도 Astra, Sol, Luna 모두 수시로 호출 제한에 걸림. MiMo 2.6pro를 시험해보니 UI 이외 작업에서 꽤 고무적이라, 당분간 지출을 이쪽으로 옮길 듯함.
약 1년째 Kimi를 중심으로 DeepSeek-V4-Pro, GLM 5.2/5.3, MiMo도 섞어 쓰는데 아주 만족스러움. 중국 모델은 훌륭하고, 다양한 용도와 취향을 충족해 줌.
DeepSeek에는 Reasonix를 강력히 추천함. DeepSeek의 접두사 캐시에 맞춰져 있어 입력 토큰의 95% 이상이 캐시에 적중하므로, 대규모 코드 분석이나 아주 긴 컨텍스트가 필요한 작업을 저렴하게 할 수 있음. 다만 일부 주의력 분산이 생기며, 데이터를 중국으로 보내야 함.
그 외 일상 작업에는 OpenRouter를 통해 Kimi K3를 OpenCode, Maki, Pi 등 그날 쓰고 싶은 도구에서 사용함. 이 구성은 중국에 데이터를 보낼 필요가 없음. Zed에서도 OpenRouter로 Kimi K3를 자주 쓰고 다른 모델도 섞어 씀.
통합 메모리 128GB MacBook의 로컬 실험에는 속도 위주로 Qwen3.6-35B-A3B, 지능 위주로 느린 Qwen3.8-27B를 사용함. 메모리가 커도 대역폭, 디코딩 제약, M4 Max의 텐서 코어 부재 때문에 기대만큼 유용하지는 않음. 큰 모델을 올릴 수는 있지만 빠르지는 않으며, 향후 M5 Studio Mac은 M5의 텐서 코어 덕분에 같은 방향에서 좀 더 빨라질 듯함.
나도 전환했고, 너무 오래 망설인 게 후회됨. 품질이나 성능 저하 없이 훨씬 적은 비용으로 더 많이 사용하게 됨.
200달러 Codex Pro 한도는 2~3일이면 소진됨. 가끔 Tibo가 한도를 초기화해주지만 GPT-5.6 계열은 코딩에 별로임. Sol은 지난 2주간 검토·자문 역할에서도 실수가 늘었고, Astra는 코딩에 쓸 만하지만 느리고 비쌈. 짧은 명세와 짧은 세션으로 단순 문구 교정만 했는데도 이틀간 70% 넘게 썼으며, 한 달 전에는 비슷한 작업에 최대 20% 정도였음. Astra는 주요 단계 검토·자문용으로만 남기고 100달러 Pro로 낮출까 고민 중이며, 주 작업은 이미 공개 가중치 모델로 옮김.
Claude는 100달러 Max의 주간 한도가 코딩 없이 검토만 해도 하루 만에 끝나고, 200달러 Pro도 코딩을 조금 섞으면 이틀이면 소진됨. Sonnet 5는 코딩에 못 쓰겠고, Opus 5는 작업마다 피할 수 있는 실수를 몇 개씩 함. Fable 5.1은 괜찮지만 스킬을 무시하고 명시적 지시를 우회하는 경향이 있어 Claude 구독은 전부 해지함.
Qwen 3.8, DeepSeek 4.1 Flash, GLM 5.3에서는 Opus 5 수준의 성능을 얻고 있으며, 쓸데없는 장황함이나 과도한 설계 변경도 적음. 공개 벤치마크가 실제를 제대로 보여주지 못함. 이 모델들도 고유한 실패 양상은 있지만 더 믿을 만하고 예측 가능함. DeepSeek 4.1 Flash는 고집이 세서 개입이 필요할 때가 있지만, 사용자와 실행 도구를 제멋대로 앞서가려는 Fable·Opus와 달리 정해진 범위와 지시는 지킴.
Grok은 흥미롭지만 SuperGrok 한도가 하룻밤 세션 한 번에 끝나 기대에 못 미침. SuperGrok+는 더 넉넉해도 OpenAI와 비슷한 수준이고, 요즘 Claude는 그보다 훨씬 적음. 주요 업체의 할당량이 줄어든 만큼 작업 속도와 예산을 유지하려면 공개 가중치 대안이 필요함. 다만 회사에서는 Anthropic에 푹 빠진 기술 경영진을 설득하기가 너무 어려움. 구독과 한도 초기화에 익숙해져 Claude의 실제 비용을 과소평가하는 경우가 있으며, OpenAI도 비싸기는 마찬가지임.
지능이 떨어진다는 증거가 실제로 있는지 진지하게 궁금함. 2023년부터 계속 반복되는 얘기인데, 이를 추적한다는 사이트를 볼 때마다 그래프는 평평하기만 함.
AA 벤치마크는 계속 바뀜. Astra가 출시됐을 때 GPT 5.6 Sol 대비 개선이 전혀 드러나지 않자 대폭 바꿔야 했음. Fable 5.0을 목록에 수동으로 다시 넣으면 여전히 Opus 5가 1점 높으므로, 실제로 수정된 것도 아님. Opus 5보다 높은 것은 Fable 5.1뿐임.
AA 지수는 외부 벤치마크와 자체 벤치마크의 가중 평균임. 결국 어려운 부분은 자신의 실제 사용 방식을 반영하는 벤치마크를 찾는 일임.
왜 그 점수 차이가 의심스러운가?
DS 4.1은 좋지만 Flash가 아닌 모델만큼 똑똑하지는 않으며, 그만큼의 학습 데이터가 없기 때문임. 탄탄한 계획을 주지 않으면 꽤 자주 엉뚱한 방향으로 감.
중국 연구소들은 한동안 벤치마크 데이터에 과적합해 점수를 높여 왔음. MiMo와 DeepSeek은 최첨단 모델에 가깝지도 않고, 주로 Luna 같은 모델과 경쟁하지만 그보다도 못함.
OpenAI나 Altman에게 돈을 주기 싫은 게 아니라면 굳이 쓸 이유가 크지 않음. 20달러 Codex 구독은 주간 한도마다 약 150달러어치 Luna 사용량을 주지만, 중국 모델에는 이렇다 할 보조금성 저가 옵션이 없음. 그나마 보조하던 OpenCode 같은 곳도 사전 공지 없이 월 한도를 60달러에서 15달러로 줄였음.
MiMo는 인상적인 모델이고 특히 가격이 뛰어남. 다만 빠르다는 부분에는 동의하기 어려움. 자체 LLM 벤치마크에서는 DeepSeek보다 빠르지만 선두 모델들보다는 여전히 훨씬 느림. KillSwitch-Bench 1.0 점수는 Claude Opus 5 66.9점, GPT-6 Astra 57.9점, Claude Fable 5.1 46.7점, MiMo-V2.6-Pro 38.8점, Muse Spark 1.3 36.5점임.
벤치마크는 https://bench.killswitch-lang.org/에서 확인 가능함.
Luna 점수가 0점인 이유가 궁금함. 제한적인 사용 경험이지만 Luna와 DSv4 Flash를 써보면 Luna가 훨씬 빠름. 출력 속도는 비슷해도 DS는 추론 과정이 끝없이 이어짐. 4.1은 아직 써보지 않음.
속도는 수요에 따라 크게 달라지는 듯함. 어젯밤에는 초당 80토큰 이상 나왔음.
초고속 엔드포인트를 쓰지 않은 결과로 보임.
MiMo-v2.6-flash도 테스트해봤는지 궁금함.
Mimo2.5는 정말 좋지만, 내 취향에는 같은 과정을 너무 반복하는 편임. 로컬에서 돌린 Pro2.5도 크게 낫지는 않았음. 한 번에 끝내는 작업에는 쓸 만하며, v2.6에서 반복 문제가 해결됐기를 바람.
과소평가된 모델이고, 써본 사람들도 대부분 무료라서 시작한 듯함. 아직 안 써봤다면 탐색할 가치가 있는 상위권 모델임.
페이지 상단에는 인공지능 1위/114개라고 적혀 있는데, 아래 그래프에서는 분명 1위가 아닌 이유가 무엇인가?
1위/114개에 마우스를 올리면 공개 가중치 모델만 대상으로 표시됨. 아마 그 때문일 듯함.
Flash 모델은 어디에 있는가? 이미 출시되지 않았나?
발표 글에는 Flash 벤치마크가 있지만, 내가 확인한 바로는 Artificial Analysis에 아직 추가되지 않음. DeepSeek V4.1 Flash도 앞서는지 궁금함. https://mimo.xiaomi.com/mimo-v2-6
설명에 “Intelligence Index 평가에서 1억 4천만 토큰을 생성해, 중앙값인 1억 4천만 토큰보다 다소 장황한 편”이라고 적혀 있음.
여러 모델에서 “비슷한 가격의 다른 모델과 비교하면 가격이 합리적”이라는 문구도 봤는데, 볼 때마다 웃김.
요즘은 이런 오류가 오히려 좋을 수도 있음. 사람이 실수했다는 건 봇이 대충 조립한 글만은 아니라는 뜻이기 때문임.
Xiaomi에 따르면 MiMo v2.6 학습 비용은 347만 달러로, 5대 업체인 MSL, xAI, GDM, OAI, Anthropic의 추정 비용인 1억 달러 이상과 큰 차이가 남. 급여와 연구개발 비용도 비슷하게 큰 격차가 있어도 놀랍지 않을 듯함.
벤치마크에서 Muse Spark 1.3과 맞먹는데, 캐시 요금이 100만 토큰당 0.0036달러로 유지된다는 점을 고려하면 MiMo v2.6 Pro는 엄청나게 저렴함.
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기