OrderMoE: 전문가 유사도 기반의 분산 엣지 MoE 추론
요약
자원이 제한된 엣지 환경에서 MoE 모델의 추론 효율을 높이기 위한 OrderMoE 프레임워크를 제안합니다. 전문가 간의 기능적 유사성을 활용하여 통신 오버헤드를 줄이고 지연 시간을 단축하는 것이 핵심입니다.
핵심 포인트
- 전문가 유사도 기반의 분산 배포 프레임워크 제안
- 라우터 유도 로짓을 활용한 전문가 유사도 모델 구축
- 로컬 대체 전문가 선택 알고리즘으로 통신량 감소
- 추론 품질 저하를 최소화하며 지연 시간 및 트래픽 개선
Mixture-of-experts (MoE, 전문가 혼합) 모델이 적절한 계산 비용으로 대규모 언어 모델 (LLM)을 확장하기 위해 점점 더 많이 채택되고 있지만, 자원이 제한적이고 대역폭이 제한된 엣지 인프라(edge infrastructures)에서 MoE 추론을 배포하는 것은 여전히 어려운 과제로 남아 있습니다. 기존의 분산 MoE 서빙 방식은 주로 정확한 전문가 배치(expert placement), 캐싱(caching), 복제(replication) 또는 통신 스케줄링(communication scheduling)에 의존하며, 전문가들 사이의 기능적 유사성(functional similarity)을 간과하고 있습니다. 이러한 유사성은 서버 간 토큰 전송을 줄일 수 있는 기회를 제공합니다. 따라서 본 논문은 추론 지연 시간(latency), 통신 오버헤드(communication overhead), 서버 워크로드(workload) 및 추론 품질(inference quality) 사이의 균형을 맞추면서 엣지 MoE 추론을 가속화하는 것을 목표로 하는, OrderMoE라고 불리는 유사도 인식 전문가 할당 및 분산 배포 프레임워크를 소개합니다. OrderMoE는 먼저 라우터 유도 로짓 표현(router-induced logits representations)을 기반으로 전문가 유사도 모델을 구축하고, 각 MoE 레이어의 전문가들을 여러 유사도 그룹으로 분할합니다. 그런 다음, 엣지 서버 전반의 로컬 유사도 커버리지(local similarity coverage)를 개선하기 위해 유사도 인식 전문가 그룹화 및 배포 전략을 개발합니다. 원격 전문가 호출(remote expert invocation)을 줄이는 것과 정확한 추론 품질을 유지하는 것은 서로 상충하는 목표이므로, OrderMoE는 토큰이 원격 대상 전문가를 호출해야 할지 아니면 실행 가능한 로컬 대체 전문가(local substitute expert)를 사용해야 할지를 결정하기 위해 품질 인식 및 궤적 인식(quality-aware and trajectory-aware) 런타임 서버-전문가 선택 알고리즘을 추가로 설계합니다. 실제 분산 엣지 테스트베드에서의 실험 결과에 따르면, OrderMoE는 미미하고 제어 가능한 수준의 추론 품질 저하만을 초래하면서 평균 지연 시간, 꼬리 지연 시간(tail latency), 서버 간 트래픽 및 원격 전문가 호출 비율을 크게 감소시킵니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기