HiKV: LLM 디코딩을 위한 하드웨어 가속 기반 계층적 중요도 인식 KV 캐시
요약
LLM 디코딩 시 발생하는 KV 캐시 메모리 병목을 해결하기 위해 알고리즘과 하드웨어를 공동 설계한 HiKV를 제안합니다. 계층적 중요도 인식을 통해 KV 캐시를 압축하며, 전용 가속기를 통해 성능과 에너지 효율을 극대화했습니다.
핵심 포인트
- 계층적 중요도 인식을 통한 2단계 KV 캐시 압축 알고리즘 제안
- 재구성 가능한 중요도 정렬기를 포함한 전용 하드웨어 가속기 개발
- 기존 방식 대비 어텐션 연산 속도 최대 7.95배 향상
- 에너지 소비 90% 절감 및 외부 메모리 액세스 대폭 감소
- 정확도 손실을 1% 이내로 유지하며 시스템 면적 증가 최소화
긴 문맥(long-context) 거대 언어 모델(LLMs)의 급격한 도입과 함께, 디코딩(decoding) 과정에서 지속적으로 증가하는 KV 캐시(KV cache)는 핵심적인 메모리 병목 현상이 되었습니다. 이러한 과제를 해결하기 위해, 우리는 계층적 중요도 인식(hierarchical importance awareness)을 통해 KV 캐시의 중복성을 활용하는 새로운 알고리즘-하드웨어 공동 설계(algorithm-hardware co-design)인 HiKV를 제안합니다. 알고리즘 측면에서, HiKV는 두 가지 입도(granularity)로 KV 캐시를 압축합니다: Stage I에서는 정해진 예산 내에서 중요하지 않은 토큰을 제거(evict)하고, Stage II에서는 유지된 각 토큰의 유의미한 요소들만 추가로 로드하여, 단일 입도에서는 달성할 수 없는 압축률을 달성합니다. 아키텍처 측면에서는, 각 단계에서 요구되는 서로 다른 정렬 데이터패스(sorting datapaths) 사이를 전환하는 재구성 가능한 중요도 정렬기(reconfigurable importance sorter)를 중심으로 한 전용 가속기를 개발하여, 최소한의 오버헤드로 두 단계의 가속을 하나의 회로로 통합했습니다. 대표적인 LLM들을 대상으로 평가한 결과, HiKV는 무시할 수 있는 수준인 1%의 정확도 손실 내에서, 기존의 바닐라(vanilla) KV 캐시 베이스라인 대비 어텐션(attention) 연산에서 최대 7.95배의 속도 향상과 90%의 에너지 절감을 달성했습니다. 동일 정확도(iso-accuracy) 제약 조건 하에서, HiKV는 외부 메모리 액세스를 추가로 1.82~4.87배 감소시킴으로써 최신 중요도 기반 방식(importance-based methods)보다 뛰어난 성능을 보여주었습니다. 이러한 이점들은 시스템 면적을 단 8%만 증가시키는 특화된 하드웨어 구성 요소들을 통해 가능해졌습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기