TRACE-ROUTER: 에이전틱 AI를 위한 작업 일관적 및 적응형 온라인 라우팅
요약
에이전틱 AI의 장기 워크플로우를 위해 작업 단위로 라우팅을 최적화하는 TRACE-Router 프레임워크를 제안합니다. 컨텍스츄얼 밴딧을 활용해 작업별로 모델을 고정하고 최종 보상을 통해 정책을 업데이트함으로써 정확도와 지연 시간의 균형을 개선합니다.
핵심 포인트
- 기존 호출 단위 라우팅의 한계를 극복하는 작업 수준 라우팅 제안
- 컨텍스츄얼 밴딧을 통한 작업 단위 모델 할당 및 정책 업데이트
- 정확도와 지연 시간의 트레이드오프를 최적화하여 파레토 프런티어 달성
- 주요 에이전틱 벤치마크에서 기존 모델 대비 높은 정확도와 낮은 지연 시간 증명
서로 다른 비용-품질 트레이드오프 (cost-quality trade-offs)를 가진 대규모 언어 모델 (LLMs)을 선택하기 위한 라우팅 (Routing)은 기업용 AI의 핵심적인 배포 기능이 되었습니다. 기존의 라우터들은 주로 각 LLM 호출에 대해 독립적인 라우팅 결정을 내립니다. 그러나 에이전틱 (agentic) 애플리케이션은 품질이 지연된 작업 수준의 결과에 의해서만 결정되는 장기 워크플로우 (long-horizon workflows)로 실행됩니다. 이러한 불일치는 호출별 라우터가 개별 라우팅 결정에 피드백을 정확하게 귀속시키는 것을 방해합니다. 이를 완화하기 위해, 우리는 라우팅을 감독 단위와 일치시키는 작업 수준 라우팅 프레임워크인 TRACE-Router를 제시합니다. TRACE-Router는 컨텍스츄얼 밴딧 (contextual bandit)을 사용하여 수락 시점에 각 작업을 모델에 한 번 할당하고, 이후의 모든 LLM 호출을 선택된 백엔드 (backend)에 고정하며, 정확도와 지연 시간 (latency)을 공동으로 고려하는 작업의 최종 보상을 사용하여 정책을 업데이트합니다. 지연된 작업 피드백을 활용함으로써, TRACE-Router는 명시적인 작업 복잡도 추정을 피하면서 워크로드에 적응하는 라우팅 정책을 학습합니다. 세 가지 에이전틱 벤치마크 (agentic benchmarks) 전반에서 TRACE-Router는 정확도-지연 시간 트레이드오프를 일관되게 개선하여, 지배되지 않는 파레토 프런티어 (Pareto frontier) 지점들을 달성합니다. tau2-Bench에서 이는 개별 모델 간의 지연 시간 매칭 보간 (latency-matched interpolation)보다 정확도 면에서 7-8포인트 더 높은 성능을 보였으며, Terminal-Bench에서는 가장 강력한 단일 모델 베이스라인보다 7.1포인트 더 높은 정확도를 달성하면서도 지연 시간은 36% 더 낮았습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기