QCATS: 효율적인 예측 질의 처리를 위한 질의 컨텍스트 인식 트랜스포머 슬라이싱
요약
본 논문은 데이터베이스 내 예측 질의 처리를 위해 QCATS라는 새로운 프레임워크를 제안합니다. QCATS는 쿼리 단위로 실행되며, 관계형 술어와 메타데이터 통계를 활용하여 필요한 FFN 슬라이스를 미리 선택함으로써 효율적인 희소 추론을 가능하게 합니다. 이를 통해 지연 시간을 크게 줄이면서도 높은 예측 정확도를 유지할 수 있습니다.
핵심 포인트
- QCATS는 데이터베이스 내에서 효율적인 희소 추론을 구현하는 프레임워크입니다.
- 쿼리 술어와 메타데이터 통계를 활용하여 필요한 FFN 슬라이스를 선택합니다.
- 최대 4.42배의 지연 시간 감소를 달성하며 예측 정확도를 유지했습니다.
데이터베이스 내 예측 질의 처리(predictive query processing)가 관계형 파이프라인 내에서 트랜스포머 기반 모델을 점점 더 많이 적용하고 있습니다. 하지만 기존의 데이터베이스 내 추론(in-database inference)은 일반적으로 튜플 수준의 모델 입력만을 추론 런타임에 노출하여, 관계형 술어(relational predicates)와 메타데이터 통계가 신경 실행 계획(neural execution planning)에 보이지 않게 만듭니다. 본 논문에서는 데이터베이스 시스템 내부에서 효율적인 희소 추론(sparse inference)을 가능하게 하는 질의 컨텍스트 인식 트랜스포머 슬라이싱 프레임워크인 QCATS를 제안합니다. QCATS는 쿼리 단위로 실행됩니다: 추론 중에 개별 토큰이나 튜플을 라우팅하는 대신, 쿼리 술어와 메타데이터 통계를 사용하여 모델 실행 전에 컨텍스트에 맞는 FFN(Feed-Forward Network) 슬라이스를 미리 선택합니다. 이 프레임워크는 오프라인 전문가 구성(offline expert construction)과 실행 중에 전문가를 동적으로 선택하는 경량의 질의 수준 라우팅을 포함합니다. QCATS는 또한 비동기 CPU-GPU 파이프라인 및 라우팅 인식 배치 처리(routing-aware batching)를 포함한 시스템 최적화를 도입합니다. BERT-base와 Qwen-0.6B를 사용한 네 가지 예측 질의 워크로드에 대한 실험 결과, QCATS는 밀집 기반 모델(dense baselines)과 비교할 수 있는 예측 정확도를 유지하면서 최대 4.42배의 지연 시간 감소를 달성하는 것으로 나타났습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기