Mistral이 공개한 Large 4 모델: 1조 개의 파라미터와 유럽 AI 경쟁력 강화 목표
요약
Mistral이 1조 개의 파라미터를 가진 대규모 MoE 모델 'Large 4'를 발표하며 유럽 AI 경쟁력 강화에 나섰습니다. 이 모델은 이미지 입력, 텍스트 생성, 100만 토큰 컨텍스트 창을 지원하며 160개 이상의 언어에서 작동합니다. 현재 Public Preview API로 제공되며, 오픈 웨이트 공개와 독립적인 테스트가 향후 성능 검증의 핵심이 될 전망입니다.
핵심 포인트
- 총 1조 개의 파라미터를 가진 MoE 구조를 채택했습니다.
- 이미지 입력 및 100만 토큰 컨텍스트 창을 지원합니다.
- 유럽 내 자체 데이터 센터에서 NVIDIA Grace Blackwell GPU로 훈련되었습니다.
- 현재 Public Preview API로 접근 가능하며, 오픈 웨이트 공개가 기대됩니다.
1조 개(trilyon)의 파라미터, 'Le Chonk'라는 별명, 그리고 유럽의 AI 경쟁에서 다시 한번 입지를 다지겠다는 목표가 하나의 모델에 결합되었습니다. Mistral이 10월 6일에 발표한 Large 4는 바로 이런 방식으로 등장했습니다. 실제로 과연 이 모델이 대적할 수 있을지는 미지수입니다... 이 대회에서는 뒤처졌다는 사실을 인정해야 합니다. 제가 이해하기로는, 그들은 오픈 소스를 통해 이러한 격차를 줄이려고 노력하고 있는 것 같습니다.
이 모델은 Mixture-of-Experts (MoE) 시스템입니다. 총 1.05조 개의 파라미터를 가지고 있지만, 토큰 하나가 처리될 때 이 중 일부만 활성화됩니다. 여기서 Mistral의 자체 페이지에도 약간의 불일치가 있습니다: 소개 문구와 일부 문서에서는 490억 개의 활성 파라미터라고 말하는 반면, 다른 공식 모델 페이지에서는 520억 개를 언급하고 있습니다. 이 구분은 아직 명확하게 정리되지 않은 상태입니다.
Large 4는 이미지를 입력받고, 텍스트를 생성할 수 있으며, 공식 문서에는 100만 토큰의 컨텍스트 창으로 명시되어 있습니다. Mistral은 또한 이 모델이 160개 이상의 언어에서 작동하며, 유럽 내 자체 데이터 센터에서 3,800개의 NVIDIA Grace Blackwell GPU로 처음부터 훈련되었다고 밝히고 있습니다.
회사의 자체 벤치마크에서는 코딩, 사이버 보안, 금융, 법률 및 시각 분석 분야에서 강력한 결과를 보였습니다. 하지만 이는 당연히 개발사 자체의 측정값입니다. 독립적인 Artificial Analysis 테스트에서는 이 모델이 Intelligence Index에서 38점을 받았습니다. 이는 미국과 중국 외 지역의 모델 중 주목할 만한 수준이지만, 중국의 가장 강력한 오픈 모델들을 능가한다는 의미는 아닙니다. 결국 저는 진정한 벤치마크는 항상 최종 사용자라고 생각합니다.
현재 이 모델은 Public Preview API로만 접근 가능합니다. 가격은 100만 토큰당 입력(input) $1.36, 출력(output) $4.18입니다. 가중치는 월말경 공개될 예정입니다. 자체 하드웨어에서 구동하고 싶은 사람들에게는 그곳에서 진정한 시험이 시작될 것입니다. 1조 개의 MoE가 요구하는 메모리와 인프라 사양은 '활성 파라미터 490억 개'라는 문구보다 훨씬 무겁습니다.
‘Le Chonk’이라는 이름은 농담일 수 있지만 모델 자체는 아닙니다. 이 모델이 얼마나 강력하고 실용적인지는 오픈 웨이트(open weights)가 공개되고 독립적인 테스트가 증가한 후에 더 명확하게 이해될 것입니다.
출처:
AI 자동 생성 콘텐츠
본 콘텐츠는 X GPU/AI 하드웨어의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기