효율적인 LLM 서빙을 위한 분산 양자화가 적용된 형태 적응형 아키텍처
요약
본 논문은 LLM 서빙의 비효율성을 해결하기 위해 DynaCore라는 통합 아키텍처를 제안합니다. 이 아키텍처는 시스톨릭 배열을 세 방향으로 재구성하고, 분산 양자화 기법(듀얼사이드/가중치 전용)을 적용하여 성능을 극대화했습니다. 실제 서빙 트레이스 평가 결과, 기존 대비 지연 시간 및 처리량에서 큰 개선을 입증했습니다.
핵심 포인트
- DynaCore는 LLM 서빙을 위한 통합 아키텍처를 제시합니다.
- 시스톨릭 배열의 MEU를 공간적/시간적으로 재구성하여 효율성을 높였습니다.
- 분산 양자화(Dual-side, Weight-only)를 적용해 메모리 및 전력 효율을 개선했습니다.
- 실제 서빙 트레이스에서 TTFT와 TPOT 등 주요 지표를 대폭 개선했습니다.
대규모 언어 모델(LLMs)은 현대 AI 애플리케이션의 핵심 기반이 되었지만, 효율적인 추론 과정에서 상당한 어려움을 야기합니다. 이들의 자기회귀적 생성(autoregressive generation)은 실행을 두 단계로 나눕니다: 대형 GEMM에 의해 지배되는 prefill과 소형 GEMV에 의해 지배되는 decoding입니다. 현대 서빙 시스템은 또한 연속 배치 처리(continuous batching)와 prefill-decoding 분리(disaggregation)를 통해 복잡성을 더하며, 이는 동적 워크로드와 단계별 분리를 초래합니다. 하지만 기존 가속기들은 이러한 시스템 수준의 동작과 제대로 정렬되지 않아 LLM 서빙에서 비효율성을 야기합니다. 본 논문에서는 시스템-아키텍처 공동 설계를 통해 효율적인 LLM 서빙을 위한 통합 아키텍처인 DynaCore를 제시합니다. 우리는 시스톨릭 배열(systolic array)이 실행하는 컴퓨트 타일, 즉 최소 유효 단위(Minimum Efficient Unit, MEU)가 세 가지 GEMM 차원 전체에 걸쳐 확장됨을 관찰했습니다. DynaCore는 이 MEU를 세 방향 모두에서 재구성합니다: 공간적으로는 배열의 너비와 높이를 비대칭적으로 교환하여 가중치 전달은 높이고 입력 경로는 그대로 유지하며, 시간적으로는 Split-K를 적용하여 축소(reduction)를 배열에 매핑하고 이미 존재하는 상호연결을 통해 부분 합계를 접습니다. 단계별 분리를 활용하기 위해, 우리는 또한 분산 양자화(disaggregated quantization)를 제안합니다. 이는 prefill에는 듀얼사이드 양자화(dual-side quantization)를, decoding에는 가중치 전용 양자화(weight-only quantization)를 적용하며, 출력 너비가 정밀도에 독립적인 내적 혼합 정밀도 데이터 경로(inner-product mixed-precision datapath)를 사용합니다. 이후 런타임 스케줄링 프레임워크는 배치당 MEU를 선택합니다. 실제 서빙 트레이스(serving traces)로 평가한 결과, DynaCore가 양자화 및 재구성 가능한 가속기 대비 서비스 수준 지연 시간(service-level latency)을 크게 줄여, TTFT를 3.50배, 2.97배 개선하고 TPOT을 각각 36.55배, 8.02배 개선함을 보여주었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기