JOVE: 리소스 인식 LLM 태스크 그래프를 위한 통합 실행 및 검증
요약
JOVE는 복잡한 추론 질의를 DAG 태스크 그래프로 분해하고 이기종 LLM에 분산 처리하는 온라인 프레임워크입니다. JOVE는 유료 검증을 통해 중간 출력을 선택적으로 검증하며, 실행 비용과 미래 학습 간의 균형을 맞추어 최적화합니다. 이를 통해 높은 정확도를 유지하면서 평균 비용과 지연 시간을 크게 절감할 수 있습니다.
핵심 포인트
- 복잡한 추론 질의를 DAG 태스크 그래프로 분해하여 처리 가능
- JOVE는 유료 검증 및 온라인 학습을 결합하여 최적화 수행
- 실행 비용과 미래 학습 간의 상충 관계를 균형 있게 관리
- 표준 기준선 대비 정확도는 유지하며 비용/지연 시간을 3.17배 감소
복잡한 추론 질의는 방향성 비순환(DAG) 태스크 그래프로 분해되어 이기종 LLM에 분산될 수 있으며, 병렬 처리를 통해 지연 시간을 줄이고 소형 모델이 복잡한 작업을 해결할 수 있도록 합니다. 그러나 실제로는 주어진 하위 작업에 대한 LLM의 적합성이 사전에 알려져 있지 않을 수 있으며, 실행만으로는 출력의 정확성을 알 수 없습니다. 우리는 JOVE라는 온라인 프레임워크를 제안합니다. 이 프레임워크는 실행할 LLM을 공동으로 할당하고 유료 검증(paid verification)을 위한 중간 출력을 선택합니다. 검증은 비동기적으로 실행되며, 미래의 할당을 개선하는 데 사용되므로, 시스템은 현재의 실행 비용 지출과 나중을 위한 학습 간의 균형을 맞추어야 합니다. 우리는 확률적이고 초기에는 알려지지 않은 LLM 서비스 품질, 호출 비용 및 실행 시간을 고려하여 장기 예산과 쿼리당 지연 시간 제약 조건 하에서 이 상충 관계를 최적화하는 방법을 연구합니다. JOVE는 일련의 쿼리별 혼합 정수 선형 계획법(Mixed-Integer Linear Programs)을 해결함으로써 실행 및 검증 결정을 내립니다. 온라인 학습은 검증 피드백을 기반으로 태스크 의존적인 LLM 품질 추정치를 업데이트하며, 정보 이득 보너스(information-gain bonus)는 할당 결정에 학습의 가치를 통합합니다. 자연스러운 일련의 가정 하에서, 우리는 JOVE가 서브리니어(sublinear)한 품질-학습 후회(quality-learning regret)를 달성함을 확립합니다. 네 가지 추론 벤치마크 전반에 걸쳐, JOVE는 표준 추론 기준선과 경쟁할 수 있는 정확도를 달성하는 동시에 평균 비용과 지연 시간을 최소 3.17배 감소시킵니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기