LightRot: 정확한 저비트 거대 언어 모델 (LLM) 추론을 위한 경량화된 회전 방식 및 아키텍처
요약
저비트 LLM 추론의 에너지 효율과 정확도를 높이기 위한 새로운 회전 방식 및 하드웨어 가속기 LightRot을 제안합니다. FHT 기반 회전 유닛과 GLR, ODA 알고리즘을 통해 LLaMA2/3 모델에서 뛰어난 성능과 에너지 효율을 입증했습니다.
핵심 포인트
- 저비트 양자화 추론을 위한 경량 회전 방식 및 전용 가속기 LightRot 제안
- FHT 기반 회전 유닛과 GLR, ODA 알고리즘을 통한 에너지 오버헤드 해결
- 28nm CMOS 공정 기준 4비트 추론 시 27.4 TOPS/W의 높은 에너지 효율 달성
- LLaMA2-13B 및 LLaMA3-8B 모델 최적화 및 MT-Bench를 통한 성능 검증
거대 언어 모델 (LLMs)이 다양한 영역에서 탁월한 능력을 지속적으로 입증함에 따라, 에너지 효율적이고 정확한 추론을 달성하는 과제가 점점 더 중요해지고 있습니다. 본 연구는 저비트 LLM 추론을 위해 설계된 경량 회전 방식 (rotation scheme) 및 전용 하드웨어 가속기인 LightRot을 제시합니다. 제안된 아키텍처는 회전 연산의 에너지 오버헤드를 포함하여 저비트 양자화 (low-bit quantization)의 주요 과제를 해결하기 위해, 계층적 Fast Hadamard Transform (FHT) 기반 회전 유닛과 함께 Grouped Local Rotation (GLR) 및 Outlier Direction Aligning (ODA) 알고리즘을 통합합니다. 28nm CMOS 공정으로 구현된 제안된 가속기는 4비트 추론에서 27.4 TOPS/W의 피크 에너지 효율을 달성하여 기존의 최첨단 (state-of-the-art) 설계들을 능가합니다. 고정밀 추론에 의존하거나 GPT-2와 같은 기본적인 언어 모델링 작업에서 평가하는 기존 방식과 달리, LightRot은 LLaMA2-13B 및 LLaMA3-8B와 같은 고급 모델에 최적화되어 있습니다. 성능은 MT-Bench를 통해 추가로 검증되었으며, 실제 대화 시나리오에 대한 강력한 적용 가능성을 입증하고 채팅 기반 AI 시스템의 벤치마크를 재정의합니다. 알고리즘 혁신과 하드웨어 효율성을 시너지화함으로써, 본 연구는 확장 가능한 저비트 LLM 추론을 위한 새로운 패러다임을 설정하고 지속 가능한 AI 발전을 위한 길을 열어줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기