
ModelExpress: 빛의 속도로 모델 아티팩트(Model Artifacts) 배포하기 - NVIDIA 기술 블로그
요약
NVIDIA ModelExpress(MX)를 통해 모델 가중치 배포 속도를 혁신적으로 개선했습니다. GPU-to-GPU RDMA 기술을 활용하여 DeepSeek-V4 Pro의 시작 시간을 8분에서 2분 미만으로 단축했습니다.
핵심 포인트
- GPU-to-GPU RDMA를 통한 가중치 이동 최적화
- DeepSeek-V4 Pro 모델 시작 시간 75% 이상 단축
- NVIDIA ModelExpress를 통한 가중치 및 커널 캐시 관리
- 추론 및 RL 사후 학습 속도 향상 효과
우리는 GPU-to-GPU RDMA를 통해 가중치(weights)를 GPU 메모리로 가장 빠른 경로를 통해 이동시킴으로써 DeepSeek-V4 Pro의 시작 시간을 8분에서 2분 미만으로 단축했습니다. 이는 NVIDIA Dynamo의 가중치 배포 및 캐시 관리 서비스인 NVIDIA ModelExpress (MX)를 사용하여 달성되었으며, 동일한 접근 방식은 추론(inference)과 RL(강화학습) 사후 학습(post-training) 속도도 높여줍니다. MX는 커널 캐시(kernel caches)를 재사용하는 반면, 추론 워커(inference workers)는 NIXL을 통해 다른 GPU로부터 업데이트된 가중치를 직접 가져와 중앙 집중식 브로드캐스트(broadcasts)를 피하고 가중치 이동이 임계 경로(critical path)에 포함되지 않도록 합니다. 블로그 포스트: https://developer.nvidia.com/blog/modelexpress-distributing-model-artifacts-at-the-speed-of-light/ /u/pmttyji에 의해 제출됨 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기