cyankiwi AWQ 4-bit 양자화 (Quantization) 소개 — 26.05 업데이트
요약
cyankiwi AWQ 26.05 업데이트는 기존 AWQ 방식의 한계를 극복하기 위해 채널별 스케일과 양자화 범위를 재구성 목적 함수를 바탕으로 공동 최적화(jointly fits)합니다. Llama-3 시리즈를 대상으로 한 벤치마크 결과, 모든 모델에서 BF16 베이스라인 대비 가장 낮은 KL 발산(KLD)을 기록하며 우수한 품질을 입증했습니다.
핵심 포인트
- 기존 AWQ의 순차적 최적화 방식에서 발생하는 반올림 오차 문제를 해결하기 위해 스케일과 양자화 범위를 공동 피팅함
- 재구성 목적 함수(reconstruction objective)를 도입하여 양자화 품질 손실을 최소화함
- Llama-3.2-3B, Llama-3.1-8B, Llama-3.3-70B 모델 테스트 결과, 타 4-bit 방식 대비 가장 낮은 KLD 달성
표준 AWQ에서는 채널별 스케일 (per-channel scales)과 양자화 범위 (quantization ranges)가 별도의 단계로 선택됩니다. 즉, 스케일을 먼저 정한 다음 양자화 파라미터를 정합니다. 하지만 이들은 독립적이지 않습니다. 즉, 한 쪽의 반올림 오차 (rounding error)가 다른 쪽의 선택에 의존하기 때문에, 이를 순차적으로 최적화하면 품질 손실이 발생합니다. 우리의 cyankiwi AWQ 26.05 업데이트는 재구성 목적 함수 (reconstruction objective)를 바탕으로 스케일과 양자화 범위를 공동으로 피팅 (jointly fits)합니다.
우리는 Llama-3를 예시로 하여 모든 주요 4-bit 방식과 cyankiwi AWQ 26.05 업데이트를 벤치마크하였으며, GPQA Diamond 응답에 대해 BF16 베이스라인 대비 KL 발산 (KL Divergence)을 측정했습니다.
결과: cyankiwi는 세 가지 베이스 모델 모두에서 가장 낮은 KLD를 기록했습니다. 값이 낮을수록 더 좋습니다.
Llama-3.2-3B-Instruct
| 양자화된 모델 (Quantized Model) | 방법 (Method) | KLD |
|---|---|---|
| cyankiwi/Llama-3.2-3B-Instruct-AWQ-INT4 | cyankiwi AWQ INT4 | 0.00510 |
| ... |
Llama-3.1-8B-Instruct
| 양자화된 모델 (Quantized Model) | 방법 (Method) | KLD |
|---|---|---|
| cyankiwi/Llama-3.1-8B-Instruct-AWQ-INT4 | cyankiwi AWQ INT4 | 0.00478 |
| ... |
Llama-3.3-70B-Instruct
| 양자화된 모델 (Quantized Model) | 방법 (Method) | KLD |
|---|---|---|
| cyankiwi/Llama-3.3-70B-Instruct-AWQ-INT4 | cyankiwi AWQ INT4 | 0.02826 |
| ... |
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기