불확실한 곳에 전문가를 배치하라: Mixture-of-Experts LoRA를 위한 신뢰도 적응형 라우팅 (Confidence-Adaptive
요약
MoE-LoRA 모델에서 토큰별 불확실성에 따라 전문가 수를 동적으로 조절하는 CARE(Confidence-Adaptive Routing of Experts) 기법을 제안합니다. Nucleus 샘플링 방식을 활용해 연산 효율성을 높이면서도 성능을 개선했습니다.
핵심 포인트
- 토큰의 불확실성을 기반으로 전문가 수를 동적으로 결정하는 CARE 방식 제안
- 고정된 k값을 사용하는 기존 MoE-LoRA 대비 연산 효율성 및 성능 개선
- 추가 파라미터 없이 단일 순전파로 즉시 적용 가능한 규칙
- LLaMA-3.1 및 Qwen2.5 모델 기반 벤치마크에서 우수한 성능 입증
- 분포 외 탐지(OOD) 성능 향상 효과 확인
Low-Rank Adaptation (LoRA)의 Mixture-of-Experts (MoE) 변형 모델들은 모든 토큰을 고정된 수의 전문가 $k$개로 라우팅합니다. 토큰마다 모델이 느끼는 불확실성의 정도가 다르기 때문에, 단일한 $k$값은 쉬운 토큰에는 과도한 자원을 소비하고 어려운 토큰에는 자원이 부족하게 제공되는 문제를 발생시킵니다. 우리는 라우터의 출력 분포가 이미 토큰별 불확실성 신호라는 점을 관찰했습니다. 즉, 집중된 질량(peaked mass)은 신뢰도를 나타내고, 평탄한 분포(flat distribution)는 모호함을 나타냅니다. 우리는 전문가를 Nucleus 방식으로 수용하는 CARE (Confidence-Adaptive Routing of Experts)를 소개합니다. 전문가들은 누적 질량이 임계값에 도달할 때까지 라우터 가중치가 감소하는 순서대로 활성화되며, 수용된 전문가들 사이의 의견이 불일치할 경우 약간의 확장이 이루어집니다. 예산 서모스탯(budget thermostat)은 평균 활성 전문가 수가 목표치와 일치하도록 임계값을 보정합니다. CARE는 추가 파라미터가 없는, 즉시 적용 가능한 단일 순전파(single-forward-pass) 규칙입니다. LLaMA-3.1-8B 및 Qwen2.5-7B를 사용한 8개의 상식 벤치마크와 수학, 코드, 지식 작업 전반에서, CARE는 동일한 연산량 대비 고정된 top-k MoE-LoRA보다 성능을 개선하였으며, 더 적은 수의 전문가를 활성화하면서도 고정된 k=4 베이스라인과 대등한 성능을 보여주었습니다. 동일한 신뢰도 및 불일치 신호는 MSP, 엔트로피(entropy), 다중 패스(multi-pass) 프록시보다 분포 외 탐지(out-of-distribution detection) 성능을 향상시킵니다. 우리는 Nucleus 충실도(fidelity), 예산 최적성(budget optimality), 그리고 불일치에 대한 인식론적 해석(epistemic reading)을 통해 이 설계를 뒷받침하며, 코드를 공개합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기