단일 RTX PRO 6000 Blackwell 96GB에서 Q4로 실행되는 Ornith-397B - 2,354 tok/s prefill
요약
MoE 중심 런타임인 Krasis를 사용하여 단일 RTX PRO 6000 Blackwell GPU에서 397B 규모의 Ornith 모델을 실행하는 기술을 소개합니다. CPU RAM과 GPU VRAM을 동적으로 관리하여 대규모 모델을 제한된 VRAM 환경에서도 효율적으로 구동할 수 있습니다.
핵심 포인트
- Krasis 런타임을 통한 MoE 전문가의 VRAM/RAM 동적 관리
- 단일 96GB GPU에서 397B 모델을 Q4 양자화로 실행 가능
- Adaptive Cold Mass Pruning을 통한 디코딩 속도 9.1% 향상
- RTX 5090(32GB) 환경에서도 Ornith-397B 실행 가능성 확인
저는 NVIDIA 소비자용/워크스테이션 GPU의 제한된 VRAM을 통해 대규모 모델을 스트리밍하기 위한 MoE (Mixture of Experts) 중심 런타임인 Krasis를 구축해 왔으며, 지금까지 가장 흥미로운 결과는 다음과 같다고 생각합니다: Ornith-1.0-397B 모델을 단일 GPU에서 대화형으로 실행하는 것입니다. 하드웨어: 1× RTX PRO 6000 Blackwell 96GB + AMD EPYC 7742 (64코어, 비록 CPU는 실행에 크게 중요하지 않지만) 및 Q4 상태의 모델을 RAM에 담을 수 있는 충분한 DDR4 시스템 RAM. 모델은 당연히 96GB에 들어가지 않으며, Krasis는 전문가(experts)들을 CPU RAM에 유지하고 어떤 전문가를 VRAM에 상주 시킬지 동적으로 관리합니다 (이번 실행에서는 라우팅된 전문가의 약 43%가 상주함). 피크 프로세스 RAM은 약 202GB였으므로, 이를 실행하려면 그 이상의 용량이 필요하지만 256GB RAM은 소비자용 DDR5 메인보드로도 가능합니다. 측정된 수치 (INT4 전문가, HQQ4 어텐션 (attention), 4-bit KV): 10,000 토큰에서 1,346.3 tok/s prefill: 7.43초, 39,920 토큰에서 2,354.5 tok/s prefill: 16.95초, 50 토큰 기준 23.58 tok/s decode, 100 토큰 기준 21.85 tok/s decode, 250 토큰 이상 지속 시 20.40 tok/s decode. Krasis Adaptive Cold Mass Pruning을 사용하면 50 토큰 기준 25.73 tok/s (+9.1%)를 기록했는데, 이는 측정된 실행 동안 라우팅된 확률 질량(probability mass)의 평균 약 1.8%만을 생략하면서 순위가 낮고 상주하지 않는 전문가 경로를 건너뛰었습니다. 동일한 런타임은 모든 것이 시스템 RAM에 들어갈 때 더 작은 MoE 모델들을 훨씬 더 빠르게 실행하며 (예: 5090에서 35B급 모델이 약 117 tok/s decode), Ornith-397B는 인내심만 있다면 단일 RTX 5090 32GB에서도 약 7.9 tok/s decode로 실행됩니다. Github repo, 속도 벤치마크, 품질 벤치마크. 질문에 답변하거나 사람들이 궁금해하는 특정 프롬프트/설정을 실행해 드릴 용의가 있습니다. submitted by /u/mrstoatey [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기