불확실성만으로는 부족하다: LoRA 전문가 혼합 모델을 위한 정보 가치 기반 라우팅 (Value-of-Information Routing
요약
LoRA 전문가 혼합(MoE) 모델에서 불확실성 대신 정보 가치(VoI)를 기준으로 라우팅하는 VI-MoLE 기법을 제안합니다. 각 전문가의 기여도를 반사실적 위험 관점에서 학습하여, 비용 대비 위험 감소 효과가 가장 큰 곳에 예산을 할당합니다.
핵심 포인트
- 불확실성을 넘어 정보 가치 기반의 라우팅 공식화
- 반사실적 위험을 활용한 인증된 정보 가치 할당
- 비용 효율적인 토큰-레이어별 어댑터 예산 배분
- 모호함과 회복 가능한 잔류 위험의 명확한 구분
저차원 적응 (low-rank adaptation, LoRA) 전문가 혼합 (Mixtures of experts) 방식은 각 입력을 어댑터(adapter)의 하위 집합을 통해 라우팅함으로써 매개변수 효율적인 용량을 증가시킵니다. 최근의 동적 라우터(dynamic routers)는 라우터나 예측이 불확실할 때 더 많은 전문가를 활성화합니다. 이러한 규칙은 불확실성을 유용한 추가 계산과 암묵적으로 동일시합니다. 즉, 불확실한 예시가 아직 질문되지 않은 보완적인 전문가 증거를 포함하고 있을 수도 있지만, 반대로 모든 전문가가 동의한 후에도 모호한 상태로 남아있을 수도 있습니다. 우리는 라우팅을 인증된 정보 가치 할당 (certified value-of-information allocation)으로 공식화합니다. VI-MoLE는 각 전문가 접두사(expert prefix) 이후에 남아있는 반사실적 위험 (counterfactual risk)을 학습하고, 이러한 예측을 홀드아웃 보정 데이터 (held-out calibration data)에 대한 동시 상한 위험 인증서 (simultaneous upper-risk certificates)로 변환하며, 단위 비용당 가장 큰 인증된 한계 위험 감소 (certified marginal risk reduction)를 보이는 토큰-레이어 행동에 전역 어댑터 예산을 할당합니다. 이후 최종 인증서가 답변할지 또는 기권할지를 결정합니다. 불확실성 게이트 (uncertainty gate)와 달리, 이 절차는 현재의 모호함과 회복 가능하며 잔류하는 위험을 구분합니다. 우리는 동시 인증서 유효성, 감소하는 인증된 이득 하에서의 최적의 탐욕적 할당 (optimal greedy allocation), 그리고 가치 추정 오차 하에서의 할당 후회 (allocation regret)를 증명합니다. 평가 프로토콜은 고정 및 동적 MoE-LoRA 라우터에 대해 일치 계산 정확도 (matched-compute accuracy), 인증서 커버리지 (certificate coverage), 위험-커버리지 (risk--coverage), 분포 변화 (distribution shift), 그리고 꼬리 지연 시간 (tail latency)을 테스트합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기