LeapQuant: 정확한 순환 상태 양자화를 이용한 효율적인 선형 어텐션
요약
LeapQuant는 LLM의 선형 어텐션 구조에서 발생하는 순환 상태 양자화 문제를 해결하는 새로운 기법입니다. 훈련 없이도 높은 정확도를 유지하며, '윈도우별 양자화'와 보상 토큰을 활용하여 오차 누적 및 이상치 문제를 완화합니다. 이를 통해 메모리/컴퓨팅 비용을 크게 줄이고 추론 속도를 향상시킵니다.
핵심 포인트
- 순환 상태 양자화를 통한 LLM의 효율적인 장문 처리 가능.
- 윈도우별 양자화와 버퍼링 업데이트로 오차 누적 완화.
- 보상 토큰과 잔여값 평활화로 모델 품질 저하 방지.
- NVIDIA GPU 환경에서 추론 속도를 1.47배 이상 향상.
최근의 대규모 언어 모델(LLM)들은 Gated DeltaNet (GDN)이나 Kimi Delta Attention (KDA)처럼 표준 어텐션을 선형 어텐션으로 대체하는 하이브리드 설계를 채택하고 있습니다. 이러한 방식은 컨텍스트를 고정 크기의 순환 상태로 압축하여 장문 처리 비용을 크게 줄여주지만, 해당 상태를 반복적으로 읽고 업데이트하는 과정 자체가 여전히 주요 추론 병목 현상(inference bottleneck)으로 남아있습니다. 양자화(Quantization)는 이러한 비용을 줄이는 자연스러운 방법이지만, 반올림 오차의 누적과 상태 내 이상치 행/열(outlier rows and columns)의 존재로 인해 모델 품질이 크게 저하될 수 있습니다. 이러한 문제들을 해결하기 위해, 우리는 LeapQuant를 제안합니다. 이는 훈련 과정 없이도 8비트 순환 상태 양자화 하에서 거의 손실 없는 성능을 달성하는 방법입니다. 첫째, 오차 누적을 완화하기 위해, 우리는 '윈도우별 양자화(per-window quantization)'를 제안합니다. 이 방식은 토큰의 한 윈도우를 건너뛰면서 해당 윈도우 끝에서만 상태를 한 번 양자화합니다. 윈도우 내부에서는 고정된 저비트 상태와 높은 정밀도의 버퍼링 업데이트(buffered updates)를 함께 사용하여 출력을 계산합니다. 둘째, 각 양자화로 인해 발생하는 오차를 줄이기 위해, LeapQuant는 상태의 가장 큰 이상치들을 몇 개의 높은 정밀도의 보상 토큰(Compensator Tokens)으로 유지하며, 이들은 실제 토큰과 업데이트 경로를 공유합니다. 그런 다음 양자화 전에 남아있는 잔여값(residual)을 평활화하여 오차를 더욱 줄입니다. Qwen, Kimi, GLM 모델군 전반에 걸친 포괄적인 실험 결과는 LeapQuant가 추론 과정에서 메모리 및 컴퓨팅 비용을 크게 줄인다는 것을 보여줍니다. FP32 기준선과 비교할 만한 정확도를 가지면서도, NVIDIA B200, RTX PRO 6000, RTX 5090 GPU에서 커널 레벨 평균 속도 향상(speedups)은 2.05~3.70배, 엔드투엔드 추론에서는 1.47배를 달성했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG (Machine Learning)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기