hummingbird: 대규모 오픈소스 Mixture of Experts (MoE) 언어 모델을 위한 경량 런타임
요약
hummingbird는 대규모 오픈소스 Mixture of Experts (MoE) 언어 모델을 위한 경량의 런타임입니다. 이 런타임은 SSD, RAM, VRAM을 통합한 지능형 메모리 계층을 활용하여 GPT-OSS 120B, GLM, DeepSeek 등 대규모 MoE 모델들을 일반 소비자 하드웨어에서도 효율적으로 추론할 수 있게 합니다.
핵심 포인트
- 대규모 오픈소스 MoE 언어 모델 지원
- SSD, RAM, VRAM을 통합한 지능형 메모리 계층 구현
- 일반 소비자용 하드웨어에서의 고효율 추론 가능
- 경량의 의존성 없는 런타임 제공
Repository: prayangshuuu/hummingbird
Language: C
Stars: 58
Forks: 12
Topics: ai-inference, artificial-intelligence, c17, cross-platform, deepseek, glm, gpt-oss, high-performance-computing, inference-engine, large-language-models, llm, llm-runtime, memory-management, mixture-of-experts, open-source, qwen, sparse-moe, systems-programming, transformers
Description:
hummingbird는 대규모 오픈소스 Mixture of Experts (MoE) 언어 모델을 위한 경량의, 의존성 없는 런타임입니다. 이는 SSD, RAM, VRAM을 단일한 지능형 메모리 계층으로 통합하여, GPT-OSS 120B, GLM, DeepSeek, Qwen 등과 같은 모델들을 일반 소비자용 하드웨어에서 추론할 수 있게 합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 GitHub ML Hardware의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기