STEPQuant: 델타 규칙 순환 상태 양자화에서 오류가 중요해지는 시점과 위치
요약
본 논문은 선형 어텐션의 순환 상태 양자화 시 발생하는 오류 문제를 다룹니다. STEPQuant라는 새로운 프레임워크를 제안하여, 시간적/공간적 관점에서 오류가 미치는 영향을 분석하고 정밀도를 할당합니다. 이를 통해 메모리 효율성을 높이면서도 높은 정확도를 유지할 수 있음을 입증했습니다.
핵심 포인트
- STEPQuant는 델타 규칙 순환 상태를 위한 시공간적 사후 학습 양자화 프레임워크입니다.
- 오류의 영향은 시간(장기 디코딩)과 공간(키 행 간 차이) 두 가지 차원에서 분석되었습니다.
- 6비트 STEPQuant는 FP32와 유사한 정확도를 유지하며, 메모리를 5배 이상 압축합니다.
- SGLang에 통합되어 GPU 커널 최적화가 가능하여 실제 서비스 적용성이 높습니다.
선형 어텐션(Linear attention)은 증가하는 KV 캐시를 고정 크기의 순환 상태로 대체하지만, 이러한 지속적인 상태는 동시 서비스 환경에서 상당한 메모리 병목 현상을 초래할 수 있습니다. 순환 상태를 낮은 정밀도로 직접 양자화하면, 양자화 오류가 연속적인 상태 업데이트를 거치면서 심각한 정확도 저하를 초래하는 경우가 많습니다. 우리는 이러한 오류의 영향이 두 가지 상호 보완적인 차원에 따라 달라진다는 것을 발견했습니다: 시간적으로는 장기간 유지되는 메모리의 오류가 많은 디코딩 단계에 걸쳐 지속될 수 있으며; 공간적으로는 서로 다른 키 행(key row)의 오류가 모델 출력에 다르게 영향을 미치고, 상태 크기가 행과 열을 따라 상당히 변화한다는 것입니다. 이러한 관찰을 바탕으로, 우리는 델타 규칙 순환 상태를 위한 시공간적 사후 학습 양자화 프레임워크인 STEPQuant를 제안합니다. STEPQuant는 오류의 크기와 메모리 수명에 따라 정밀도를 할당하고, 상태 분포와 키 행이 출력 오류에 미치는 영향을 기반으로 키 행과 값 열(value column) 스케일을 공동으로 최적화합니다. Qwen3.8-27B 및 Kimi-Linear-48B-A3B-Instruct 모델을 장기 및 단기 생성 벤치마크에서 실험한 결과, STEPQuant는 명목상 6비트 예산 하에서 FP32 상태의 정확도와 근접하게 일치하며, 4비트 구성에서는 균일 INT8보다 성능이 우수함을 보여주었습니다. SGLang에 통합되고 최적화된 GPU 커널을 통해, 6비트 STEPQuant는 순환 상태를 5배 이상 압축하고 전체 서비스 메모리를 최대 68.7%까지 줄입니다. 저희 코드는 https://github.com/Dreamer-Toby/STEPQuant에서 이용 가능합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기