VDAR-Router: 언어화된 질의 난이도 분석 검색을 통한 적응형 LLM 라우팅
요약
VDAR-Router는 질의의 난이도를 분석하여 적절한 LLM을 할당하는 검색 기반 라우팅 프레임워크입니다. 기존의 의미론적 접근 대신 명시적인 난이도 분석과 유사 사례 검색을 통해 비용 대비 성능을 최적화합니다.
핵심 포인트
- 질의의 근본적인 난이도를 분석하여 모델 적합성을 추정함
- 유사한 난이도 프로필을 가진 과거 사례를 검색하여 활용
- 보상 함수를 통해 성능과 비용의 트레이드오프를 최적화
- 훈련이 필요 없는(training-free) 효율적인 라우팅 방식 제안
대규모 언어 모델 (Large language models, LLMs)은 실제 시스템에서 점점 더 많이 사용되고 있으며, 이에 따라 배포 비용을 줄이기 위한 효율적인 모델 선택이 중요해지고 있습니다. LLM 라우팅 (LLM routing)은 원하는 비용 대비 성능 (cost-performance trade-off) 하에서 각 입력 질의 (input query)를 적절한 모델에 할당하기 위한 실용적인 솔루션으로 등장했습니다. 기존의 라우팅 방법들은 종종 입력 질의의 표면적 의미론 (surface semantics)이나 임베딩 유사도 (embedding similarity)를 통해 모델의 적합성을 추정합니다. 그러나 이러한 방법들은 질의의 근본적인 난이도를 무시할 수 있으며, 이는 최적화되지 않은 라우팅 결정으로 이어질 수 있습니다. 이러한 문제를 해결하기 위해, 우리는 난이도를 인지하는 검색 기반 라우팅 프레임워크인 VDAR-Router를 제안합니다. VDAR-Router는 각 입력 질의에 대해 먼저 명시적인 난이도 분석 (difficulty analysis)을 생성합니다. 그런 다음 유사한 난이도 프로필을 가진 과거 사례들을 검색합니다. 검색된 기록을 바탕으로, 후보 모델의 적합성을 추정하고 성능과 비용을 모두 고려하는 보상 함수 (reward function)를 사용하여 모델을 선택합니다. 세 가지 데이터셋에 대한 실험 결과, VDAR-Router는 기존 베이스라인 (baselines)보다 일관되게 더 나은 비용 대비 성능 트레이드오프를 달성함을 보여줍니다. 이러한 결과는 훈련이 필요 없는 (training-free) LLM 라우팅을 위한 난이도 인지 검색의 효과를 입증합니다. 사례 연구 (Case studies)를 통해 명시적인 질의 분석이 더 관련성 높은 사례를 검색하는 데 도움이 되며, 더 신뢰할 수 있는 라우팅 결정을 지원한다는 것을 추가로 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기