FareedKhan-dev/glm-5.2-in-c
요약
7,440억 개의 파라미터를 가진 MoE 모델인 GLM-5.2를 순수 C 기반 추론 엔진으로 구현했습니다. int4 양자화와 전문가 스트리밍 방식을 적용하여 단 16GB RAM만으로 구동 가능하며, 이를 통해 효율적인 LLM 배포 및 벤치마킹이 가능합니다.
핵심 포인트
- GLM-5.2를 순수 C 기반 추론 엔진으로 구현함.
- int4 양자화와 전문가 스트리밍을 적용하여 메모리 효율성을 높임.
- 단 16GB RAM만으로 대규모 LLM 구동이 가능해짐.
Repository: FareedKhan-dev/glm-5.2-in-c
Language: C
Stars: 69
Forks: 18
Topics: c, consumer-hardware, cpu-inference, cuda, deep-learning, edge-ai, glm, inference-engine, int4, large-language-models, llm, llm-inference, machine-learning, mixture-of-experts, moe, quantization, speculative-decoding, systems-programming
Description:
GLM-5.2는 7440억 개의 파라미터를 가진 Mixture of Experts (MoE) 모델을 순수 C 기반 추론 엔진으로 구현했습니다. int4로 양자화(quantized)되었으며, 전문가(experts)들은 디스크에서 스트리밍되고 배포 및 벤치마킹되었습니다. 단 16 GB의 RAM만 사용하여 구동할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 GitHub ML Hardware의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기