Mistral의 새로운 Large 4 모델, 독립 테스트에서 일부 중국 오픈 소스 모델에 뒤처지다
요약
Mistral이 수조 개의 매개변수를 가진 Large 4 (ML4) 모델을 출시하며 오픈 가중치 성능의 최전선을 제시했습니다. 이 MoE 모델은 사이버 보안 측정 항목에서 최고 기록을 달성했으나, 전반적인 지능 테스트에서는 일부 중국 오픈 소스 모델에 뒤처지는 모습을 보였습니다. 이 모델은 미국과 중국 외 지역에서 가장 지능적인 모델로 평가받았으며, 가중치 공개 후 사이버 지수 상위권 진입이 예상됩니다.
핵심 포인트
- Mistral Large 4는 MoE 구조의 대규모 오픈 가중치 모델입니다.
- 사이버 보안 측정 항목(CyberGym-E2E-AA)에서 높은 성능을 보였습니다.
- 전반적인 지능 테스트에서는 일부 중국 경쟁 모델에 능가하지 못했습니다.
- 비용 효율성 측면에서는 기존 경쟁 모델 대비 비용이 높게 책정되었습니다.
Mistral은 이번 주에 수조 개의 매개변수(trillion-parameter)를 가진 Large 4 (ML4) 모델을 출시하며, 이 모델이 “오픈 가중치 성능의 최전선을 밀어낸다”고 밝혔습니다. 독립적인 AI 벤치마킹 회사인 Artificial Analysis (AA)는 Mistral의 Large 4를 미국과 중국 외 지역에서 사용 가능한 최고의 모델로 순위 매겼습니다. Nvidia의 Grace Blackwell GPU로 훈련된 이 Mixture-of-Experts (MoE) 모델은 AA의 CyberGym-E2E-AA 종단 간 사이버 보안 측정 항목에서 개인 최고 기록을 달성했지만, 전반적으로는 여러 중국 오픈 소스 모델에 능가했습니다.
Mistral은 Artificial Analysis Intelligence Index에서 38점을 받은 Mistral Large 4를 출시했습니다. 프랑스가 미국과 중국 외 지역에서 가장 지능적인 모델을 보유한 국가로 돌아왔습니다. @MistralAI는 1조 개 매개변수(49B 활성) 모델의 가중치를 10월 말에 공개할 계획으로 Mistral Large 4를 Research Public Preview 형태로 출시했습니다. 이 모델은 Artificial Analysis Intelligence Index에서 38점을 달성하여, GPT-6 Luna (최대 38점) 및 DeepSeek V4.1 Flash (최대 39점)와 유사합니다. 또한 Artificial Analysis Cyber Index에서는 GLM-5.3-Flash와 동등한 50점을 달성했으며, Kimi K3나 DeepSeek V4.1 Flash (최대) 같은 모델보다 앞섰습니다. Mistral Large 4 Preview의 주요 벤치마킹 결과:
➤ 미국과 중국 외 지역에서 가장 지능적인 모델: Mistral Large 4 Preview는 Intelligence Index에서 38점을 기록하여, DeepSeek V4.1 Flash (최대 39점) 및 GPT-6 Luna (최대 38점)와 유사합니다. 이는 대한민국이나 아랍에미리트 같은 국가보다 지능적인 모델임을 의미합니다.
➤ 사이버 방어 능력에서 GLM-5.3-Flash와 동등: Mistral Large 4 Preview는 Artificial Analysis Cyber Index에서 50점을 기록하여, GLM-5.3-Flash (50점)와 동등하며 MiMo-V2.6-Pro (56점)보다 낮습니다. 가중치가 공개되면 사이버 지수 상위 세 개 오픈 소스 모델 중 하나로 순위에 오를 것입니다.
가장 강력한 결과는 CyberGym-E2E-AA에서 나타났는데, 여기서 82%를 기록하며 MiMo-V2.6-Pro(79%)와 GPT-6 Luna(최대치, 78%)보다 앞섰습니다.➤ 유사 지능의 오픈 웨이트 모델 대비 작업당 비용이 4배 이상 높음: Mistral Large 4 Preview는 표준 가격 $1.36/1M 입력/출력 토큰, $4.18/1M 입력/출력 토큰, 캐시된 입력 토큰은 $0.14/1M로 작업당 $1.13의 비용이 발생합니다. 첫 2주 동안 Mistral Large 4 Preview는 50% 출시 할인으로 제공되어 작업당 비용을 $0.57까지 낮춥니다. 이는 여전히 GLM-5.3-Flash($0.25)와 DeepSeek V4.1 Flash(최대치, $0.27)보다 비쌉니다.➤ 강력한 문서 및 이미지 추론: Mistral Large 4 Preview는 GDP.pdf에서 19%를 기록하여 MiMo-V2.6-Pro(19%)와 동등하며 Kimi K3(22%)에는 뒤처집니다. 이는 이전 Mistral 모델의 경우 요청당 8개였던 것에서 현재 API가 100개의 이미지를 허용하도록 개선되면서, Mistral Large 3 대비 18점 향상된 수치입니다.
주요 모델 세부 정보:
➤ 컨텍스트 창: 512k 토큰
➤ 멀티모달리티: 텍스트 및 이미지 입력, 텍스트 출력
➤ 가격 책정: 1M 입력/출력 토큰당 $1.36/$4.18 (캐시된 입력 토큰은 1M당 $0.14), 첫 2주 동안 50% 할인 적용 ($0.68/$2.09)
➤ 사용 가능 여부: Mistral API의 연구 공개 프리뷰, 오픈 웨이트는 10월 말 예정
October 6, 2026
ML4는 Artificial Analysis Intelligence Index v4.3.2에서 38점을 기록했으며, AA에 따르면 이는 ML4를 “미국과 중국 외 지역에서 가장 지능적인 모델”로 만들었다. 최소 다섯 개의 중국 오픈 모델가 이 지수에서 더 높은 점수를 기록했다: DeepSeek V4.1 Flash (max)는 39점, GLM-5.3-Flash는 42점, Kimi K3 (max)은 44점, GLM-5.3 (max)은 45점, 그리고 MiMo-V2.6-Pro는 46점을 기록했다. MiMo-V2.6-Pro가 ML4와 총 크기 면에서 비슷하지만, GLM-5.3-Flash는 총 파라미터 수 320B에 비해 약 1/3의 크기이며 활성 파라미터 수는 18B로 ML4의 49B–52B보다 적다. 다른 모델들과 달리, ML4는 아직 오픈되지 않았다: Mistral에 따르면 가중치(weights)는 “이달 말까지” 공개될 예정이다.
Mistral Large 4 대 중국 오픈 모델들의 Artificial Analysis 지능 지수 (10월 6일)
|
모델 |
지수 점수 |
파라미터, 총/활성 |
지수 작업당 비용 |
가중치 |
| --- | --- | --- | --- | --- |
| Xiaomi MiMo-V2.6-Pro | 46 | 1.0T / 42B | $0.13 | 오픈 |
| Z.ai GLM-5.3 (max) | 45 | 753B / 40B | $2.01 | 오픈 |
| Moonshot Kimi K3 (max) | 44 | 2.8T / 104B | $2.00 | 오픈 |
| Z.ai GLM-5.3-Flash | 42 | 320B / 18B | $0.25 | 오픈 |
| DeepSeek V4.1 Flash (max) | 39 | 552B / 16B | $0.27 | 오픈 |
| Mistral Large 4 Preview | 38 | 1.05T / 49B–52B | $1.13 ($0.57 at launch pricing) | 이달 말까지 공개 예정 |
| DeepSeek V4 Pro 0813 (max) | 36 | 1.6T / 49B | $0.67 | 오픈 |
비용은 또 다른 문제입니다. ML4의 리스트 가격은 AA당 1.13달러이며, 50% 할인된 출시 가격으로는 0.57달러입니다. 이는 MiMo-V2.6-Pro의 0.13달러 및 GLM-5.3-Flash의 0.25달러와 비교됩니다. 비록 상대적으로 비싸지만, ML4는 AA가 '최고의 결과'라고 부르는 성적을 거두었으며, CyberGym-E2E-AA에서 81.7% 점수를 기록하여 Mistral이 '아직 개발 중인(still in flight)' 후속 학습을 진행한다고 주장하는 모델의 GLM-5.3-Flash의 74%와 비교됩니다.
점수가 인상적임에도 불구하고, 이는 Cyber Index의 세 가지 테스트 중 하나일 뿐입니다. ML4는 DeepsecBench-AA에서 16%, CWE-Bench-AA에서 51%를 기록했습니다. 하지만 AA의 예측에 따르면, 가중치(weights)가 배포되면 'Cyber Index 상위 3개 오픈 웨이트 모델 중 하나로 자리매김할 것'이라고 합니다. 이는 ML4가 더 좁은 작업에 적용될 여지를 남겨둡니다.
Mistral Large 4의 Artificial Analysis Cyber Index 및 세 가지 테스트 (10월 6일)
|
모델 |
Cyber Index |
CWE-Bench-AA |
DeepsecBench-AA |
CyberGym-E2E-AA |
| --- | --- | --- | --- | --- |
| Grok 4.7 (xhigh) | 56 | 68% | 27% | 74% |
| Xiaomi MiMo-V2.6-Pro | 56 | 63% | 26% | 79% |
| OpenAI GPT-6 Luna (max) | 53 | 57% | 24% | 78% |
| Z.ai GLM-5.3-Flash | 50 | 56% | 20% | 74% |
| Mistral Large 4 Preview | 50 | 51% | 16% | 82% |
| OpenAI GPT-6 Astra (max; declined some tasks) | 33 | 63% | 37% | 0% |
| Anthropic Claude Opus 5.5 (max with fallback; declined some tasks) | 29 | 58% | 27% | 1% |
Mistral는 ML4가 “사이버 보안, 금융, 법률”과 같은 엔터프라이즈 워크로드에서 오픈 모델 중 “최첨단(state-of-the-art)”이라고 주장하며, 특히 1.6B 매개변수 비전 인코더를 활용하는 시각적 접지(visual grounding) 분야에서는 “최첨단 폐쇄형 모델을 능가할 수 있다”고 말합니다. Mistral에 따르면 AA의 Cyber Index에서 ML4는 “글로벌 상위 5개 모델 중 하나”로 순위를 차지하며, 보안 경진대회에서 가져온 40가지 과제로 구성된 Cybench의 93%를 해결합니다.
CEO Arthur Mensch는 아부다비에서 이 모델이 사이버 분야를 포함한 특정 측면에서 “중국 모델보다 우수하다”고 더 언급했습니다. Mistral의 다른 수치로는 DeepSWE v1.1 점수 61.7%, Coding Agent Index 점수 49.8%, AutomationBench 점수 59.9%, Dense 200 점수 42%가 있으며, AA 자체 차트에서는 ML4가 Terminal-Bench 4.0에서 27%를 기록했습니다.
실제로 ML4는 CyberGym-E2E-AA 테스트에서 OpenAI의 폐쇄형 GPT-6 Luna (max)보다 높은 점수를 받았지만, Luna는 AA 지수에서 ML4와 동일한 38점을 달성하며 작업당 비용은 약 1/16 수준($0.07)입니다. Mistral에 따르면 Claude Opus 5.5 및 GPT-6 Astra 같은 최첨단 모델들은 “작업 수행을 거부하기 때문에” 같은 테스트에서 점수가 거의 0점에 가깝고, AA 차트에서는 이 두 모델 모두 안전상의 이유로 일부 작업을 기피하는 것으로 표시되어 있습니다.
해당 테스트 외적으로도 Mistral은 ML4가 DeepSeek V4 Pro 0813 및 Qwen3.8 Max보다 Coding Agent Index에서 우수하며, AA에 따르면 후자들보다 저렴하다고 말합니다. 전반적으로 AA의 지수 대 비용 차트에서는 ML4가 파레토 선(Pareto line) 아래에 위치하며 “가장 매력적인 사분면” 바로 밖에 있습니다.
비용은 AA 지수를 실행하는 데 2억 토큰의 출력 토큰이 필요하여, 중앙값인 8,100만 토큰과 비교됩니다. 속도 면에서는 ML4가 초당 116.1 토큰을 생성했으며 첫 번째 토큰까지 걸리는 시간은 1.46초였습니다. 이는 ML4를 티어 중앙값보다 약 33% 더 빠르고, 첫 토큰까지는 2.6배 더 빠른 수준에 위치시킵니다. AA의 속도는 Mistral 자체 API에서 측정되었으며, Mistral에 따르면 이 API는 모델이 학습하는 데 사용된 것과 동일한 하드웨어에서 실행됩니다.
ML4는 "유럽에 위치한 Mistral 자체 데이터센터에서 3,800개의 NVIDIA Grace Blackwell GPU를 사용하여 처음부터 학습되었다"고 회사 측은 밝혔다. 이는 작년에 출시된 Large 3를 학습하는 데 사용된 3,000개의 Nvidia H200보다 늘어난 수치이며, Large 3는 총 파라미터가 675B이고 활성 파라미터(active)가 41B로 더 작았다. 이 학습은 _VentureBeat_에 보도된 바와 같이 "약 두 달"에 걸쳐 진행되었다.
Mistral은 회사 측이 "유럽 기술 기업 역사상 가장 큰 규모의 지분 투자 라운드"라고 부르는 €30억 규모의 Series D 투자를 유치했다. Mistral Compute는 작년에 Nvidia와 함께 발표한 바와 같이 18,000개의 Grace Blackwell 칩를 계획하고 있다. Mistral은 "자체 유럽 데이터센터에서 컴퓨팅 용량을 상당히 확장하고 있으며", ML4가 "차세대 전문화되고 최적화된 Mistral 모델의 기반"이 될 것이라고 말한다. 이 모델의 오픈 웨이트(open weights)는 출시되는 대로 사설 클라우드나 온프레미스 환경에서 구동될 수 있을 것이다.
웨이트, 아키텍처 세부 정보 및 추가 벤치마크는 10월 말 이전에 공개될 예정이다. Artificial Analysis는 웨이트가 도착할 때까지 미리 보기(preview)를 독점적인 것으로 명시하고 있다. 일단 공개되면 모델은 재평가될 수 있으며, Mistral의 주장은 검증대에 오르게 될 것이다. 출시 후 처음 두 주 동안 ML4는 할인된 요금으로 API를 통해 사용 가능하다.
유럽 모델들이 아직 증명해야 할 것이 많지만, 이전 성능과 더 저렴한 중국 모델 대비 8포인트 격차로 보여준 ML4의 실적을 바탕으로, Mistral은 의지를 보여주었으며 적어도 틈새 응용 분야(niche application)를 가진 모델을 생산하여 궁극적으로 그 격차를 줄이는 기반을 마련했다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Tom's Hardware의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기