L0 정규화 기반 Mixture-of-Experts를 통한 밀집형 대규모 언어 모델 가속화
요약
본 논문은 LLM 추론 과정의 느린 속도와 높은 비용 문제를 해결하기 위해 L0 정규화를 활용한 경량 MoE 접근 방식인 L0-MoE를 제안합니다. 이 방법은 밀집형 LLMs 대비 성능 손실을 최소화하면서 최대 2.5배의 속도 향상을 달성했습니다.
핵심 포인트
- L0 정규화를 사용하여 밀집형 LLM 가속화에 적용 가능
- 제안된 L0-MoE는 기존 기준선보다 우수한 성능을 보임
- 경쟁력 있는 성능 유지와 최대 2.5배의 속도 향상을 동시에 달성함
대규모 언어 모델(LLMs)은 강력한 성능을 달성하지만, 느리고 비용이 많이 드는 추론 과정의 어려움을 겪습니다. 기존의 가속화 방법들은 종종 눈에 띄는 성능 저하를 초래하며, Mixture-of-Experts (MoE) 모델은 방대한 컴퓨팅 자원을 필요로 합니다. 본 논문에서는 L0-정규화를 사용하여 밀집형 LLMs를 거의 성능 손실 없이 가속화하는 경량 MoE 접근 방식인 L0-MoE를 제안합니다. 저희 방법은 도메인 인식 데이터셋 큐레이션을 위한 클러스터 혼란 행렬(cluster confusion matrix)을 도입하고, 효율적인 학습을 위해 동적 배치 처리(dynamic batching)를 적용합니다. 실험 결과에 따르면, L0-MoE는 기존의 LLM 가속화 기준선들을 능가하며 경쟁력 있는 성능을 유지하면서 밀집형 모델 대비 최대 2.5배의 속도 향상을 달성하는 것으로 나타났습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기