Eider: DGX Spark용 추론 런타임
요약
NVIDIA DGX Spark(Grace Blackwell)를 위한 Rust 및 CUDA 기반의 경량 추론 런타임인 Eider를 소개합니다. 기존 라이브러리 없이 SM121 GPU의 NVFP4 기능을 활용하며, 전문가(expert) 페이지 인/아웃 기능을 통해 대규모 모델을 효율적으로 실행합니다.
핵심 포인트
- Rust와 CUDA로 구축된 독자적인 경량 추론 런타임
- SM121 GPU의 NVFP4 기능을 활용한 최적화
- 디스크 기반 전문가 페이지 인/아웃으로 메모리 한계 극복
- Qwen, Gemma, Nemotron 등 다양한 최신 모델 지원
- OpenAI 호환 API 및 연속 다중 세션 스케줄링 제공
저는 NVIDIA DGX Spark (GB10, Grace Blackwell) 및 해당 변형을 위한 작은 추론 및 서빙 런타임을 만들었습니다. 다른 분들도 흥미롭거나 유용하다고 생각하실 수 있을 것 같습니다. https://github.com/rdaum/eider/ 이 런타임은 SM121 GPU의 NVFP4 기능을 활용하기 위해 Rust와 CUDA로 처음부터 구축되었습니다. 기존의 어떤 텐서 또는 추론 라이브러리 위에도 구축되지 않았으며, llama.cpp나 vLLM을 사용하지 않습니다. Qwen3.6 dense 및 MoE, Agents-A1, StepFun의 Step-3.7-Flash, Gemma 4 26B-A4B, 그리고 NVIDIA의 Nemotron 3 Puzzle 하이브리드 모델을 실행할 수 있습니다. 주로 제가 작업해보고 싶었던 것들이기 때문입니다. 가장 흥미로운 기능 중 하나는 디스크에서 전문가(expert)를 페이지 인/아웃 할 수 있는 능력으로, 이 덕분에 vLLM이 불가능한 (그리고 llama.cpp는 더 낮은 품질의 양자화만 가능한) 상황에서도 Step 3.7 Flash 등을 메모리에 올릴 수 있습니다. Qwen, Step, Gemma 어텐션 경로를 위한 OpenAI와 호환되는 Responses 및 Chat Completions 서버와 연속적인 다중 세션 스케줄링, 그리고 간결한 NVFP4 KV 캐시가 포함되어 있습니다. Nemotron은 백본 어텐션과 Mamba 순환 상태를 결합합니다. 이것은 개인 연구 프로젝트로 시작되었으며, 더 많은 프로덕션 엔진을 향해 나아가고 있습니다 -- 네, 커널 계층의 대부분은 에이전트가 작성했습니다. 저는 수학에 능하거나 똑똑하지는 않습니다. 하지만 작동은 합니다. 대부분의 경우 말이죠. 한번 사용해보시고 버그나/혹은 미흡한 점을 보고해주세요. 이 시점에서 (제가 배우는 것 외에) 주요 목표는 llama.cpp나 vLLM이 NVFP4 또는 다른 SM121 최적화 작업을 할 때까지 기다릴 필요 없이 로컬 코딩 등을 수행할 수 있는 더 집중된 빠른 시작 런타임을 갖는 것입니다. 저에게 너그러워해주세요. submitted by /u/Comrade-Porcupine to r/LocalLLaMA [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기