CompKV: 장문 컨텍스트 LLM 추론을 위한 보상 인식 KV 선택
요약
CompKV는 장문 컨텍스트 LLM 추론 시 발생하는 KV 캐시 메모리 트래픽 병목 현상을 해결하기 위한 새로운 보상 인식 희소 어텐션 프레임워크입니다. 기존 방법들이 선택과 보상을 분리하여 상호작용을 놓쳤던 한계를 극복했습니다. CompKV는 토큰을 블록으로 나누고, 다운스트림 보상 메커니즘까지 고려하여 선택을 명시적으로 최적화합니다.
핵심 포인트
- CompKV는 장문 컨텍스트 LLM 추론의 KV 캐시 트래픽 문제를 해결합니다.
- 선택과 보상을 통합하여 상호작용을 놓치지 않는 것이 핵심입니다.
- 토큰 블록 단위로 선택을 최적화하는 최초의 보상 인식 희소 어텐션 프레임워크입니다.
- RULER 및 LongBench-Pro에서 최대 6.85배의 셀프 어텐션 속도 향상을 입증했습니다.
강력한 성능에도 불구하고, 대규모 언어 모델(LLMs)은 장문 컨텍스트 추론 과정에서 KV 캐시 메모리 트래픽에 의해 병목 현상을 겪습니다. 희소 어텐션(Sparse attention)은 선택된 토큰의 정확한 어텐션을 계산하여 LLM 추론을 가속화하기 위해 널리 사용됩니다. 정확한 어텐션에서 제외된 토큰의 기여도를 복구하기 위해, 최근 방법들은 생략된 어텐션 테일에 거친(coarse-grained) 보상(compensation)을 적용합니다. 하지만 기존 방법들은 일반적으로 어텐션 질량(attention mass)을 기반으로 토큰을 선택한 다음, 비선택된 토큰에 대해 보상만 수행한다는 문제가 있습니다. 이러한 분리된 설계는 이들 간의 상호작용을 놓치고 있습니다: 선택은 제외될 경우 가장 큰 보상 오차를 남길 토큰을 우선시해야 합니다. 이러한 한계를 해결하기 위해, 우리는 CompKV를 소개합니다. 이는 토큰을 블록으로 나누고 다운스트림 보상 메커니즘을 위해 선택을 명시적으로 최적화하는 최초의 보상 인식 희소 어텐션 프레임워크입니다. 우리의 이론적 분석에 따르면, 블록 수준 평균 보상에 의해 남겨지는 잔여분(residual)은 블록 어텐션 질량과 블록 내 로짓 변화(within-block logit variation) 모두에 의해 결정됩니다. 우리는 이를 간결한 블록 수준 통계를 사용하여 근사화함으로써 배포 가능한 선택 기준을 얻습니다. 또한 효율적인 비동기 구현을 개발했습니다. RULER와 LongBench-Pro에서의 실험 결과, CompKV는 평가된 희소 베이스라인 중 가장 좋은 성능을 보였으며, 전체 어텐션 대비 최대 $6.85 imes$의 셀프 어텐션 속도 향상을 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기