효율적인 저비트 LLM 추론을 위한 이질성 인식 마이크로스케일링 (Heterogeneity-Aware Microscaling)
요약
저비트 LLM 추론의 정확도 손실을 줄이기 위해 양자화 이질성을 고려한 새로운 마이크로스케일링 방식인 AdaMX를 제안합니다. AdaMX는 추가적인 비트 폭 증가 없이 블록 및 피연산자별로 최적의 정밀도를 선택하여 정확도를 크게 개선합니다.
핵심 포인트
- 양자화 이질성을 인식하여 블록 및 피연산자별 최적 형식 선택
- MXFP4 대비 MMLU 및 상식 테스트에서 정확도 손실 대폭 감소
- 22nm FD-SOI AI 가속기 프로토타입을 통한 하드웨어 구현 검증
- Gemma-4 12B 등 멀티모달 모델에서도 높은 성능 유지
마이크로스케일링 (Microscaling, MX)은 이제 저비트 거대 언어 모델 (LLM) 추론의 표준입니다. MX의 4비트 형태인 MXFP4는 여전히 상당한 정확도 손실을 겪는데, 이는 기존 MX 형식이 블록 전체에 걸쳐 요소 형식 (element format) 또는 정밀도 복구 방식 (precision-recovery scheme) 중 하나를 고정하여 제한적인 양자화 이질성 (quantization heterogeneity)만을 포착하기 때문입니다. 양자화 이질성은 두 가지 수준에서 나타납니다: 1) 블록 간 (across blocks), 선호되는 요소 형식과 정밀도 복구 방식이 달라집니다; 2) 피연산자 간 (across operands), 가중치 (weights)와 활성화 함수 (activations)는 서로 다른 인코딩을 필요로 합니다. 우리는 이질성을 인식하는 형식 및 가속기인 AdaMX (Adaptive Microscaling)를 소개합니다. AdaMX는 등가 비트 폭 (equivalent bit width, EBW)의 증가 없이 블록당 정밀도 복구 방식을 선택하고 피연산자당 표현 방식을 선택합니다. 하나의 설계로 두 가지 블록 크기를 커버하여, 더 높은 정확도의 동작 지점과 저장 공간을 절약하는 더 낮은 EBW 동작 지점을 제공합니다. 우리는 제안된 디코더, 연산 유닛 및 양자화 로직을 포함하는 22nm FD-SOI AI 가속기 프로토타입을 구현했습니다. FP4 전용 곱셈기를 사용하는 동일한 조건의 MXFP4 가속기와 비교했을 때, AdaMX는 시스템 에너지를 약 1% 추가합니다. 더 낮은 EBW 지점에서 AdaMX는 메모리 사용량과 에너지를 모두 낮추면서도 베이스라인보다 더 높은 정확도를 유지합니다. 3B에서 70B 규모의 LLM 전반에 걸쳐, AdaMX는 상식 (commonsense) 테스트에서 MXFP4 정확도 손실의 83%를, MMLU에서 82%를 제거했으며, NVFP4 손실의 경우 각각 43%와 27%를 제거했습니다. AdaMX는 멀티모달 모델로도 일반화됩니다. Gemma-4 12B에서 AdaMX는 4가지 시각-언어 (vision-language) 벤치마크 모두에서 MXFP4를 앞서며, FP16 정확도의 최대 96%를 유지합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기