Mistral Large 4: “Le Chonk”
요약
Mistral이 1조 개 파라미터 규모의 네이티브 멀티모달 모델 Mistral Large 4(ML4) 프리뷰를 공개했습니다. ML4는 코딩, 에이전트 작업, 사이버보안 등 핵심 업무에서 최고 수준의 성능을 보이며, 유럽 자체 데이터센터 인프라와 오픈웨이트 전략을 통해 AI 주권을 강조합니다. 가중치는 이달 말 공개될 예정입니다.
핵심 포인트
- 1조 파라미터 규모의 ML4 프리뷰를 출시하여 역량을 입증했습니다.
- 사이버보안 및 코딩 분야에서 최고 수준의 성능(CyberGym-E2E 82%)을 기록했습니다.
- 유럽 자체 데이터센터와 오픈웨이트 전략으로 AI 주권을 확보합니다.
- 가중치는 이달 말 공개되며, 고객이 자체 정책에 따라 운영 가능합니다.
- Mistral이 총
1조 개 파라미터, 활성 파라미터 490억 개를 갖춘 네이티브 멀티모달 모델 Mistral Large 4의 공개 프리뷰를 출시함 - Mistral 평가에서
코딩, 에이전트 작업, 멀티모달 이해가 세계 최상위 오픈 모델과 경쟁하며, 사이버보안, 금융, 법률에서는 오픈 모델 최고 수준의 성능을 보임 - 유럽 자체 데이터센터의
NVIDIA Grace Blackwell GPU 3,800개로 처음부터 학습했으며, 이달 말 가중치 공개와 자체 배포를 통해 고객이 자체 정책에 따라 AI를 운영하도록 지원할 예정임 - 보안 취약점 재현 및 패치 평가에서
82%로 전체 모델 중 최고점을 기록했으며, 간접 프롬프트 인젝션 저항성과 악성 사이버 요청 거부율도 높은 수준을 보임 - 프리뷰의
강화학습은 현재도 진행 중이며, Mistral은 인프라 확장과 함께 추가 성능 향상을 기대하고 ML4를 특화 및 최적화 모델의 기반으로 활용할 계획임
공개 프리뷰와 가중치 공개 계획
Mistral Large 4(ML4) 의 별칭은 “le Chonk”이며, Mistral이 지금까지 개발한 모델 중 규모와 역량이 가장 큼
- Mistral 평가에서는 세계 최상위 오픈소스 모델과 경쟁하며, 미국이나 유럽에서 개발한 오픈웨이트 모델을 크게 앞섬
- 사이버보안, 금융, 법률 등 기업의 핵심 업무에서는
오픈 모델 최고 수준이며, 시각적 그라운딩 일부 영역에서는 최상위 비공개 모델도 넘어섬
가중치는 이달 말 공개할 예정이며, 그 전까지 사이버보안 선도 조직, 검증된 파트너, 국가 당국과 실제 환경에서 레드팀 테스트를 진행함
-
해당 참여자는 제한을 완화하고 사이버 역량을 확장한 동일 모델에 접근함
-
프리뷰 API를 제공하며, 가중치 공개에 맞춰 아키텍처, 추가 벤치마크, 사후학습 방법의 세부 내용을 공개할 예정임
유럽 인프라와 AI 주권
-
ML4는 유럽 내 Mistral 자체 데이터센터에서
NVIDIA Grace Blackwell GPU 3,800개로 처음부터 학습했으며, 공개 프리뷰도 같은 인프라에서 운영함
오픈웨이트와 자체 배포를 통해 조직이 자체 정책에 따라 고급 보안 업무를 수행하도록 지원할 계획임 -
공급자 차원의 거부는 정당한 취약점 연구와 사고 대응을 막을 수 있으며, 사고 대응 도중 기능 접근을 잃는 것 자체가 중대한 보안 위험이 될 수 있음
-
전 세계 여러 지역에서 제공할 예정이며, 유럽 배포는
다른 디지털 서비스 제공자에 의존하지 않고 Mistral이 전 과정을 운영하며 유럽법을 따름 -
학습 데이터의 상당 부분이 다국어 데이터이며,
EU의 모든 공식 언어를 포함한 160개 이상 언어를 포괄함 -
금융, 엔지니어링, 제조, 물류, 제약, 과학, 해운, 공공 부문 등 핵심 산업의 글로벌 기업들과 협력해 학습함
사이버보안 성능과 운영 자율성
- 실제 소프트웨어의 보안 결함 탐지 및 수정 능력을 평가하는
Artificial Analysis Cyber Index에서 세계 상위 5개 모델에 들며, 중국 외 지역에서 개발한 오픈웨이트 모델을 큰 차이로 앞섬 - 실제 오픈소스 취약점을 재현하고 패치하는
CyberGym-E2E에서 82% 로 전체 모델 중 최고점을 기록함 - 보안 대회에서 가져온 40개 과제로 구성된 Cybench에서는 93%를 해결해 오픈웨이트 모델의 최고 수준 기록 중 하나를 달성함
Claude Opus 5.5와 GPT-6 Astra 등 일부 비공개 모델은 같은 취약점 재현 및 패치 과제를 거부해 점수가 0에 가까움
-
소프트웨어 방어는 결함이 실제로 존재함을 입증하는 데서 시작하는 경우가 많지만, 비공개 모델의 안전 필터가 이를 차단할 수 있음
-
위협 행위자가 같은 모델을 탈옥시켜 공격에 활용하는 상황에서, 방어자도 이러한 거부에 제한받지 않는 대응 역량이 필요함
-
내부 테스트에서는 명시적으로 학습한 범위를 넘어
악성코드 분석, 취약점 우선순위 지정, 탐지 규칙 작성에도 유용했음 -
학습 분포 밖의 악성코드 역공학 조사 과제도 시험함
-
주권과 감사 가능성이 필요한 보안 조직은 향후 프라이빗 클라우드나 온프레미스에서 실행할 수 있음
에이전트 코딩과 업무 자동화
-
소프트웨어 엔지니어링, 저장소 이해, 복잡한 터미널 작업 평가에서
Coding Agent Index 49.8% 를 기록해 DeepSeek V4 Pro 0813과 Qwen3.8 Max를 앞섬 -
DeepSWE v1.1은
61.7%, SWE-Atlas-QnA는 59.4%, Terminal-Bench 4.0은 28.3%임 -
이 점수들은 평가 하네스 공개 전에 Artificial Analysis가 비공개로 측정했으며, 하네스 공개 후 해당 지수에 반영될 예정임
-
Surge AI와 진행한
블라인드 코딩 품질 평가에서는 전문 평가자가 모델 이름을 모른 채 결과물을 1~5점으로 채점함 -
ML4 Preview는
3.74점으로 5개 모델 중 2위를 기록함 -
Claude Opus 5가 4.22점으로 앞섰으며, Kimi K3는 3.59점, GLM-5.3은 3.60점, GLM-5.2는 3.40점임
범용 에이전트로 정보를 수집하고 도구를 사용하며 복잡한 작업의 최종 결과물을 생성함
- Gmail, Google Sheets, Slack, Salesforce 등의 657개 업무 흐름으로 구성된 AutomationBench에서
59.9% 를 기록해 Kimi K3, MiMo-V2.6-Pro, DeepSeek V4 Pro를 앞섬 - 스프레드시트, 슬라이드, PDF 등 장기 지식 업무를 평가하는 AA-Briefcase에서는 1,393 Elo로 DeepSeek V4 Pro를 앞섬
멀티모달 이해와 시각적 그라운딩
복잡한 문서, 차트, 자연 이미지를 이해하고 추론하며, 엔지니어링, 제조, 지구 관측처럼 시각 인지가 중요한 산업의 작업을 지원함
시각적 그라운딩과 에이전트 기능을 결합해 확대, 검사, 검증을 반복할 수 있음
- 시연에서는 밀집된 자연 장면의 대상 식별, 기술 도면의 기계 부품 확인, PDF 증거 검색, 거대한 지리공간 이미지 속 작은 대상 탐색을 수행함
- 기가픽셀 위성 이미지를 검사해 재난 대응을 돕거나 엔지니어링 도면을 분석하는 작업에 활용함
Dense 200에서 42% 를 기록해 GPT-6-Astra의 41%를 넘어섬
- 관련 멀티모달 평가에는 ChartQA Pro와 GDP.pdf도 포함됨
과학, 수학과 전문가 평가
AI 기반 방법과 수학, 물리학, 화학 연구진의 전문성을 결합해 과학 역량을 개발함
-
데이터 분석, 모델링, 물리적 현상 시뮬레이션 등
과학 작업의 에이전트 코딩을 지원함 -
물리학, 수학, 재료과학, 생물학의 복잡한 과학 작업을 코드로 구현하는 SciCode-Verified에서 오픈웨이트 모델 최고 수준을 기록함
-
여러 고급 루틴으로 구성되는 복잡한 화학 계산인
Hartree–Fock 시뮬레이션 전체를 한 번에 생성할 수 있음 -
내부 인간 평가에서
GLM-5.3보다 정확하고 구조적인 수학 추론을 보였으며, 최첨단 이론물리학 관련 작업을 포함한 장시간의 전문 응용수학 과제를 수행할 수 있음 -
이러한 역량으로 첫 질문부터 최종 결과까지 전체 기술 연구 과정을 지원함
-
코딩, CAD, 금융, 수학, 물리학 전문가의 내부 비교 평가에서는
CAD와 STEM에서 ML4를 선호함 -
금융과 코딩에서는 GLM-5.3과 동등하거나 근접한 성능을 보임
금융과 법률 지식 업무
복잡한 스프레드시트와 문서의 생성, 편집, 수정을 지원하며, Mistral 모델 중 실제 전문 업무 수행 역량이 가장 높음
- 제3자 평가기관 vals.ai를 통한 대표 금융 및 법률 과제 평가에서
두 영역 모두 GPT-6-Astra를 앞섬 - HarveyAI의 Legal Agent 벤치마크에서는 모든 오픈소스 모델보다 높은 성능을 기록함
- 관련 평가에는 Finance Agent v2와 Finch(FinWorkBench)가 포함되며, FinWorkBench는 실제 금융 및 회계 사례의 스프레드시트 생성과 편집 능력을 시험함
기업 재무 분석 시연에서는 ML4와 다른 상위 오픈소스 모델이 같은 다단계 과제를 수행함
- EDGAR와 유럽의 유사 데이터베이스에서 공개 기업 공시 및 재무 보고서를 검색함
- 애니메이션 의미 지도로 검색한 문서, 수집한 증거, 계산 결과, 미해결 질문을 추적해 각 모델이 최종 답변에 도달하는 경로를 비교함
모델 안전성
-
Mistral의
간접 프롬프트 인젝션 견고성 벤치마크에서 포화 수준에 도달했으며, GLM-5.2, GLM-5.3, Kimi-K2.6, Kimi-K3, DS-V4-Pro-0813과 비교해 오픈소스 모델 최상위 수준임 -
Lakera의 공개 B3 AI Security Benchmark에서
공격의 93.3%를 방어했으며, Mistral이 확인한 경쟁 모델 중 더 높은 점수는 없었음 -
사용자와의 책임 있는 상호작용을 평가하는 KORA Benchmark에서는
1.691점으로 Mistral이 측정한 오픈소스 모델 중 최고점을 기록함 -
최고점은 “Exemplary”에 해당하는 2점이며, 이전 Mistral 모델보다 책임 있는 상호작용을 보임
-
강한 사이버 역량에도 불구하고
악성 사이버 요청의 평균 거부율은 평가한 모든 오픈소스 모델보다 높음
대규모 강화학습 구조
-
기본 모델이 발전하면 과거의 정답 샘플과 사후학습 방식만으로는 역량을 충분히 끌어내기 어려워지므로
강화학습(RL) 을 사용함 -
모델이 직접 시도한 결과로 학습하며, 역량이 높아질수록 과제 난도와 범위를 넓힐 수 있음
-
RL 라이브러리의
공통 조합형 인터페이스로 새로운 환경을 쉽게 추가하고, 하나의 학습 실행에 다양한 과제를 결합함 -
단일 턴 대화, 복잡한 과학 문제, 안전성 정렬, 사실성, 장기 도구 사용을 함께 학습함
-
환경들은 코드 샌드박스, 웹 검색, 외부 API 등 실행 틀과 자원을 공유함
-
검증에는 보상 모델, 단위 테스트, LLM 심사자, 정적 검사를 과제별로 조합함
-
실행 시
자동 확장 실행기 집합이 수만 개의 롤아웃을 병렬 생성하고, 모델 학습은 비동기로 진행함 -
생성 및 학습 파이프라인은 긴 실행 경로에 최적화되어 여러 차례 압축을 거치는 수백만 토큰 규모의 롤아웃을 지원하면서 데이터가 낡는 정도를 낮게 유지함
-
양 단계의 새로운 방법과 최적화로
오프폴리시 드리프트를 최소화하고 장기 과제에서 안정적인 RL을 수행함 -
현재
GPU 3,000개 규모의 단일 학습 실행에서 하루 약 330억 토큰을 생성함 -
필터링과 마스킹 후 학습에 사용할 수 있는 완성 응답 토큰은 약
160억 개임 -
정책이 더 복잡한 과제를 해결하면서 여러 대표 환경의 학습 보상이 상승함
-
성능 향상은 학습 환경에만 국한되지 않고
후속 평가로도 전이되며, 최종 성능에는 지도 미세조정과 RL 모두 기여함
인프라 확장과 후속 모델
-
ML4는
30억 유로 규모 시리즈 D로 조달한 자금에 기반한 로드맵의 첫 이정표임 -
Mistral에 따르면 유럽 기술 기업 사상 최대 지분 투자 라운드이며, 이 자금으로 유럽 자체 데이터센터의 연산 용량을 크게 확장하고 있음
-
향후 수개월 동안 더 많은 용량을 가동할 예정임
-
프리뷰를 만든
강화학습 실행은 아직 진행 중이며, Mistral은 모델 성능에 포화 징후가 없다고 밝힘 -
확장 인프라에서 학습을 늘리면서 향후 수주와 수개월 동안 크고 빠른 성능 향상을 기대함
-
ML4를 기반으로 고객 산업과 작업에 맞춘
차세대 특화 및 최적화 Mistral 모델을 개발할 계획임
댓글과 토론
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기