Prefill-Decode 분리(Disaggregation)를 넘어: 동적 연산자 스케줄링을 통한 이기종 플랫폼용 LLM 추론 분석
요약
LLM 추론 성능을 최적화하기 위해 연산자 스케줄링과 가중치 레이아웃을 공동 최적화하는 DOPS 프레임워크를 제안합니다. NPU와 PIM 등 이기종 하드웨어 환경에서 Prefill-Decode 분리 방식보다 뛰어난 속도 향상을 입증했습니다.
핵심 포인트
- 동적 연산자 스케줄링(DOPS)을 통한 LLM 추론 최적화
- Bifocal 스케줄러를 통한 연산자-장치 배치 최적화
- 메모리 제약 하의 효율적인 가중치 레이아웃 선택(WLA)
- NPU 및 PIM 결합 이기종 시스템에서 최대 2.23배 속도 향상
Prefill-decode 분리 (Prefill-decode disaggregation, PD) 및 roofline 기반 연산자 배치 (operator placement)는 이기종 시스템 전반에 걸쳐 대규모 언어 모델 (Large Language Model, LLM) 추론을 분할하기 위한 일반적인 전략이지만, 실제 환경에서는 불충분한 경우가 많습니다. 엔드투엔드 지연 시간 (End-to-end latency)은 워크로드 형태 (workload shape), 런타임 장치 경합 (runtime device contention), 그리고 지속적인 가중치 레이아웃 (persistent weight layout)에도 의존합니다. 본 논문에서는 연산자 스케줄링 (operator scheduling)과 블록 단위 가중치 레이아웃 (blockwise weight layouts)을 공동으로 최적화하는 하드웨어 인식형 폐루프 프레임워크인 DOPS (dynamic operator scheduling)를 제시합니다. DOPS는 스테이지 인식형 유향 비순환 그래프 (stage-aware directed acyclic graph, DAG)를 구축하며, 두 가지 구성 요소를 통합합니다: 동적인 연산자-장치 배치 (operator-to-device placement)를 위한 Bifocal 스케줄러와 엄격한 메모리 제약 조건 하에서 하드웨어 효율적인 가중치 레이아웃을 선택하기 위한 Weight Layout Arbiter (WLA)입니다. 신경망 처리 장치 (Neural Processing Units, NPUs)와 지능형 메모리 (Processing-in-Memory, PIM) 장치를 결합한 대표적인 이기종 시스템 전반에서, Bifocal은 PD 베이스라인 대비 1.20$ imes$에서 2.23$ imes$의 기하 평균 속도 향상 (geometric-mean speedups)을 달성했습니다. WLA는 Bifocal/Linear 대비 1.28$ imes$에서 1.33$ imes$의 추가적인 기하 평균 속도 향상을 제공합니다. 또한 DOPS는 LLM 서빙을 위한 워크로드 민감도 (workload sensitivity) 및 하드웨어 확장성 (hardware scalability)의 체계적인 분석을 지원합니다. 소스 코드는 https://github.com/YIAI-02/TriForm 에서 확인할 수 있으며, 시각화 도구는
에서 시연됩니다.AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기