MixFrag: Vision Transformers를 위한 취약성 가이드 혼합 정밀도 사후 훈련 양자화
요약
Vision Transformers(ViTs)의 효율적인 배포를 위해 구성 요소별 민감도를 고려한 혼합 정밀도 사후 훈련 양자화(PTQ) 프레임워크인 MixFrag를 제안합니다. KL 발산을 통해 양자화 취약성을 측정하고 MCKP를 통해 최적의 비트 할당을 수행합니다.
핵심 포인트
- 구성 요소별 양자화 민감도를 측정하는 취약성 가이드 방식 제안
- KL 발산을 활용하여 전체 정밀도와 양자화 출력 간의 차이 추정
- 다중 선택 배낭 문제(MCKP)를 통한 적응형 계층별 비트 할당
- ImageNet, COCO 데이터셋에서 기존 PTQ 대비 SOTA 성능 달성
사후 훈련 양자화 (Post-training quantization, PTQ)는 자원이 제한된 장치에 Vision Transformers (ViTs)를 배포하기 위한 효과적인 솔루션으로 부상했습니다. 그러나 기존의 PTQ 방법들은 일반적으로 트랜스포머 구성 요소 전체에 걸쳐 균일한 비트 너비 (bit-widths)를 채택하며, 양자화에 대한 구성 요소들의 이질적인 민감도를 간과하여 비효율적인 정밀도 할당을 초래합니다. 본 논문에서는 Vision Transformers를 위한 취약성 가이드 혼합 정밀도 PTQ 프레임워크인 MixFrag를 제안합니다. MixFrag는 먼저 작은 보정 세트 (calibration set)를 사용하여 전체 정밀도 (full-precision)와 격리된 양자화 출력 분포 사이의 Kullback--Leibler (KL) 발산을 측정함으로써 구성 요소 수준의 양자화 취약성을 추정합니다. 그런 다음 비트 할당을 다중 선택 배낭 문제 (Multiple-Choice Knapsack Problem, MCKP)로 공식화하여, 목표 비트 예산 내에서 적응형 계층별 정밀도 할당을 가능하게 합니다. 다양한 Vision Transformer 아키텍처에 대해 ImageNet-1K에서 수행된 광범위한 실험은 MixFrag가 실제적인 혼합 정밀도 설정 하에서 경쟁력 있는 분류 성능을 달성함을 보여줍니다. 또한, COCO 객체 탐지 (object detection) 및 인스턴스 분할 (instance segmentation)에 대한 평가 결과, MixFrag는 기존의 혼합 정밀도 PTQ 방법들 사이에서 최첨단 (state-of-the-art) 성능을 달성하였으며, 까다로운 MP3/MP3 설정 하에서 이전의 최고 방법보다 최대 9.6 AP를 개선했습니다. 추가적인 분석을 통해 제안된 취약성 지표를 검증하고, 이것이 학습된 비트 할당과 강력한 상관관계가 있음을 입증합니다. 이러한 결과는 MixFrag를 Vision Transformers의 혼합 정밀도 사후 훈련 양자화를 위한 효과적인 프레임워크로 확립합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기