전문가 예측 선행(expert lookahead)을 이용한 MoE SSD 스트리밍 성능 10%+ 개선
요약
전문가 예측 선행(expert lookahead) 기법을 적용하여 MoE 모델의 SSD 스트리밍 성능을 10% 이상 개선했습니다. 이 방법은 Qwen 3.8 flash와 같은 MoE 모델을 저용량 Mac 환경에서 사용할 때, 다음 전문가를 미리 예측하고 로드함으로써 효율성을 높입니다.
핵심 포인트
- MoE SSD 스트리밍 성능을 expert lookahead로 10%+ 개선 가능
- Qwen 3.8 flash 등 MoE 모델에 적용 가능한 최적화 기법
- 현재 은닉 상태를 이용해 라우터를 N-2 레이어 앞서 실행하여 예측함
저는 전문가 예측 선행(expert lookahead)이라는 트릭을 구현했습니다. 이 방법은 저용량 Mac에서 실행되는 MoE 모델(이 경우 Qwen 3.8 flash)에 expert-offloading/ssd-streaming(slotstream 사용)을 사용할 때 성능을 10% 이상 향상시킵니다. 이는 여러 최적화 위에 추가된 10% 수치입니다. 처음에는 전문가들을 N 레이어 앞서 예측하는 작은 모델을 훈련시켜 미리 메모리에 로드할 수 있도록 했지만, 결국 이 모델 자체가 최고의 예측기임이 밝혀졌습니다. 많은 실험 끝에 저는 N=2로 결정했습니다. 따라서 현재 계산이 실행되는 동안 slotstream은 현재 은닉 상태(hidden state)를 사용하여 Qwen의 라우터(router)를 2 레이어 앞서 실행하여 로드할 다음 전문가들을 예측합니다. 현재는 그 위에 작은 보정 모델을 훈련시키고 있으며, 이는 추가적으로 약 3~4%의 개선 효과를 가져다줍니다. Qwen 3.8 flash용 expert-lookahead: https://github.com/carloslfu/slotstream/blob/main/docs/EXPERT-LOOKAHEAD.md /u/carloslfu가 제출함 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기