PagedWeight: 동적 품질 인식 가중치 양자화(Dynamic Quality-Aware Weight Quantization)를 통한
요약
MoE 모델 서빙 시 발생하는 가중치 메모리와 KV cache 간의 트레이드오프를 해결하기 위한 PagedWeight를 제안합니다. 런타임에 전문가 가중치를 동적으로 양자화하여 메모리 효율성과 모델 정확도 사이의 균형을 최적화합니다.
핵심 포인트
- MoE 모델의 가중치와 KV cache 간 메모리 불균형 문제 해결
- 런타임 동적 양자화를 통한 품질-메모리 트레이드오프 최적화
- 기존 방식 대비 최대 72% GPU 메모리 절감 및 1.94배 처리량 향상
- FP16 수준의 정확도를 유지하며 메모리 효율성 극대화
Mixture-of-Experts (MoE)는 높은 효율성과 정확도를 제공하는 대규모 언어 모델 (LLMs)의 인기 있는 클래스입니다. 그러나 KV-cache 집약적인 서빙 시나리오에서, MoE는 모델 가중치의 GPU 메모리 요구 사항과 증가하는 KV cache 사이의 긴장 관계를 자주 나타냅니다. 우리는 MoE 모델의 가중치를 런타임에 동적으로 양자화(quantize)하고 전문가 가중치(expert-weight) 정밀도와 KV cache 크기 사이의 균형을 맞추는 새로운 MoE LLM 서빙 관리 방법인 PagedWeight를 제안합니다. PagedWeight는 모델의 작업 정확도, 메모리 소비, 그리고 처리량/지연 시간(throughput/latency) 사이의 복잡한 트레이드오프(tradeoff)를 드러내고 효과적으로 탐색합니다. 여러 메모리 민감형 MoE 서빙 시나리오에 걸쳐, PagedWeight는 기존의 여러 양자화 베이스라인(quantization baselines)보다 품질-메모리 트레이드오프를 개선합니다. PagedWeight는 최대 72.0%의 GPU 메모리 절감과 1.94$ imes$의 처리량 향상을 달성하면서 FP16과 동등한 정확도를 확보하며, 유사한 메모리 예산 내에서 양자화 방법들보다 품질을 최대 39.3% 개선하면서 처리량 손실은 최대 4.1%로 제한합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기