GEM: MoE 시스템을 위한 GPU 가변성 인지 전문가-GPU 매핑
요약
MoE(Mixture-of-Experts) 모델의 추론 과정에서 발생하는 GPU 간 성능 불균형과 동기화 장벽 문제를 해결하기 위한 GEM 프레임워크를 제안합니다. GEM은 GPU의 가변성을 인지하여 전문가(experts)를 비균등하게 배치함으로써, 가장 느린 GPU에 의해 전체 처리가 지연되는 병목 현상을 완화합니다. 실험 결과, 기존 방식 대비 엔드투엔드 지연 시간을 최대 16.5%까지 개선하는 성과를 거두었습니다.
핵심 포인트
- MoE 모델의 추론 성능은 가장 느린 GPU(straggler GPU)의 처리 속도에 의해 제한되는 동기화 장벽 문제를 가짐
- 기존 방식은 토큰 부하 균형에만 집중하여 GPU 자체의 성능 가변성을 간과하는 한계가 있음
- GEM은 전문가를 '일관된 전문가'와 '일시적 전문가'로 구분하여 GPU 가변성에 맞춰 전략적으로 매핑함
- GPU 가변성 프로필과 작업별 토큰 부하 분포를 활용하여 최적의 전문가-GPU 매핑을 수행함
- GEM 적용 시 엔드투엔드 지연 시간을 평균 7.9%, 최대 16.5% 단축 가능
Mixture-of-Experts (MoE) 모델은 더 작은 전문가(experts)들을 채택하고 토큰당 그중 일부 서브셋만을 활성화함으로써 효율적인 추론을 가능하게 합니다. MoE 서빙 엔진은 전문가들을 여러 GPU에 분산시키고, 추론 시점에 활성화된 전문가를 기반으로 토큰을 적절한 GPU로 라우팅합니다. 이들은 토큰을 락스텝(lock-step) 방식으로 처리하며, 배치(batch) 내의 토큰들이 다음 레이어로 넘어가기 전에 반드시 처리를 완료해야 합니다. 이러한 동기화 장벽(synchronization barrier)은 MoE 모델의 성능이 가장 마지막에 처리를 마치는 지연 GPU(straggler GPU)에 의해 제한되기 때문에 결정적인 병목 현상으로 작용합니다. 지연 GPU는 너무 많은 고부하 전문가가 동일한 GPU에 배치되거나 가장 느린 GPU에 배치될 때 발생합니다. 기존 연구들은 GPU 간의 토큰 부하를 균형 있게 맞추도록 전문가를 배치하지만, GPU 가변성(GPU variability)을 간과하여 자주 사용되는 전문가를 가장 느린 GPU에 배치하는 경우가 많습니다. 우리는 MoE 모델을 위해 GPU 가변성을 인지하여 전문가를 GPU에 매핑하는 프레임워크인 GEM(GPU-variability-aware Expert Mapping)을 제안합니다. GEM은 두 가지 통찰을 활용합니다. 첫째, 각 GPU가 자신의 가변성에 따라 비균등한 토큰 부하를 받도록 전문가를 배치하여 모든 GPU가 거의 동시에 레이어 처리를 마쳐야 합니다. 우리의 연구에 따르면 전문가에는 대부분의 시간 동안 사용되는 일관된(consistent) 전문가와 나머지 시간 동안 자주 함께 사용되는 일시적(temporal) 전문가라는 두 가지 유형이 있습니다. 우리의 두 번째 통찰은 지연을 줄이기 위해 동시에 사용되는 일관된 전문가와 일시적 전문가를 서로 다른 GPU에 배치하고, 이들을 느린 GPU에 배치하는 것을 피해야 한다는 것입니다. GEM은 각 모델과 작업(task)에 대한 GPU의 가변성 프로필을 수집하고, 작업별 토큰 부하 분포를 사용하여 전문가를 GPU에 매핑합니다. 실험 결과, GEM은 베이스라인(baseline) 대비 엔드투엔드(end-to-end) 지연 시간을 평균 7.9%, 최대 16.5%까지 개선함을 보여주었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기