효율적인 LLM 추론을 위한 통합 정적-동적 프루닝 (Unified Static-Dynamic Pruning)
요약
LLM 추론의 병목 현상을 해결하기 위해 정적 프루닝(SP)과 동적 프루닝(DP)을 통합한 SPDP 프레임워크를 제안합니다. 새로운 Tiled-CBC 형식과 GPU 커널 설계를 통해 메모리 대역폭 효율과 연산 강도를 동시에 최적화합니다.
핵심 포인트
- 정적 및 입력 적응형 동적 프루닝을 결합한 통합 희소 추론 프레임워크 SPDP 제시
- Tiled-CBC 형식과 전용 CUDA 커널 설계를 통한 GPU 연산 최적화
- 기존 프레임워크 대비 최대 2.51배의 속도 향상 달성
- 높은 희소성에서도 퍼플렉시티를 유지하며 추론 효율성 개선
대규모 언어 모델 (LLMs)의 배포가 증가함에 따라, 낮은 연산 강도 (compute intensity)와 대역폭 제한적 (bandwidth-bound) 커널이 추론 비용을 지배하는 자기회귀 디코딩 (autoregressive decoding)의 연산 및 메모리 병목 현상이 심화되고 있습니다. 가중치 프루닝 (Weight pruning)은 유망한 해결책을 제공하지만, 기존 방법들은 중복된 가중치를 영구적으로 제거하지만 적응성이 부족한 정적 프루닝 (Static Pruning, SP) 또는 입력 희소성 (input sparsity)에는 적응하지만 런타임 불규칙성을 초래하는 동적 프루닝 (Dynamic Pruning, DP) 중 하나에 국한되어 있습니다. 본 논문은 GPU 상에서 효율적인 LLM 추론을 위해 비구조적 (unstructured) SP와 입력 적응형 DP를 통합하는 통합 희소 추론 프레임워크인 SPDP를 제시합니다. SPDP는 새로운 Tiled-Column-wise Bitmap Compressed (Tiled-CBC) 형식과 두 가지 상호 보완적인 GPU 커널을 공동 설계합니다: (1) 미세한 런타임 활성화 건너뛰기 (activation skipping)를 위한 Hybrid Activation-aware Dynamic Shared-Memory Bitmap Decoding (HAD-SMBD) 기능을 갖춘 CUDA-core spMspV 커널, 그리고 (2) 프리필 (prefill) 연산에 최적화된 Tensor-Core SpMM 커널입니다. 이러한 통합 형식-커널 설계는 정적 및 동적 희소성을 조화시켜, LLM 추론의 두 단계 모두에서 대역폭 효율적인 메모리 액세스와 높은 연산 강도를 유지합니다. 추론 최적화 GPU에서의 종합적인 평가 결과, SPDP는 SpInfer와 같은 최첨단 희소 프레임워크 대비 평균 1.24배~1.37배(최대 2.51배)의 속도 향상을 달성하는 동시에, 최대 25% 더 높은 희소성에서도 퍼플렉시티 (perplexity)를 유지함을 입증했습니다. SPDP는 추론 효율성-품질 파레토 프런티어 (Pareto frontier)를 진전시키며, 통합 정적-동적 프루닝이 대규모 LLM 서빙에서 상당한 처리량(throughput) 및 와트당 성능 (performance-per-watt) 향상을 제공할 수 있음을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기