세상에! 고수가 Mac Studio에서 Kimi K3를 직접 구동하게 만들었습니다!
요약
2.8T 파라미터 규모의 Kimi K3 모델을 Mac Studio에서 구동할 수 있도록 최적화한 사례를 소개합니다. 스트리밍 컨버터와 REAP 프루닝 기술을 통해 모델 용량을 1.6TB에서 350GB로 압축하여 Apple Silicon 환경에서 실행 가능하게 만들었습니다.
핵심 포인트
- 2.8T 규모의 Kimi K3 모델을 Mac Studio에서 구동 성공
- 스트리밍 컨버터를 통한 메모리 로드 최적화
- REAP 프루닝 기술로 모델 용량을 350GB로 압축
- MLX 포팅 및 양자화 도구 오픈 소스 공개
세상에! 고수가 Mac Studio에서 Kimi K3를 직접 구동하게 만들었습니다!
누군가 해낼 줄은 알았지만, 이렇게 빠를 줄은 몰랐네요~
보통 외국인들의 효율이 낮다고들 하지 않나요?
2.8T 파라미터(Parameter) 규모의 Kimi K3를 이제 Mac Studio에서 구동할 수 있습니다.
K3의 원래 용량은 1.6TB였기에, Apple Silicon으로는 도저히 감당할 수 없는 수준이었습니다.
Pipe Network는 두 가지 방법을 사용하여 이를 350GB까지 압축했습니다. 첫 번째는 스트리밍 컨버터(Streaming Converter)를 작성하여 모델을 한 층씩 로드함으로써, 전체 모델을 한꺼번에 메모리에 넣지 않도록 한 것입니다.
두 번째는 REAP 프루닝(Pruning, 가지치기)입니다. 캘리브레이션 데이터(Calibration Data)를 바탕으로 896개의 전문가(Expert)에게 점수를 매겨, 현재 작업에 실제로 필요한 것들만 남겼습니다.
그 결과, 원래는 대규모 클러스터에서만 구동 가능했던 최첨단 MoE(Mixture of Experts) 모델이 Mac Studio 안으로 들어왔습니다.
그들은 MLX 포팅(Porting), 변환 스크립트, 프루닝 도구 및 양자화(Quantization) 버전을 모두 오픈 소스로 공개했습니다.
주소는 댓글창을 확인하세요👇
AI 자동 생성 콘텐츠
본 콘텐츠는 X @berryxia (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기