최근접 이웃 매칭으로서의 벡터 검색: 인과 추론에서의 RAG 기반 정책 학습
요약
RAG를 활용하여 인과 추론 프레임워크 내에서 정책 학습을 수행하는 새로운 1단계 및 2단계 방법론을 제안합니다. 벡터 검색을 최근접 이웃 매칭으로 공식화하여 행동 선택의 정확도를 높이는 연구입니다.
핵심 포인트
- RAG 기반 행동 선택을 잠재적 결과 프레임워크로 공식화
- 벡터 검색을 인과 추론의 최근접 이웃 매칭과 연결
- 후회(Regret)를 후보 생성 및 후보 내 선택 단계로 분해
- 트랜스포머 모델을 위한 예측 오차 보장 메커니즘 제공
우리는 검색 증강 생성 (RAG, Retrieval-Augmented Generation)을 이용한 정책 학습을 위한 1단계 및 2단계 방법을 제안합니다. 우리는 잠재적 결과 프레임워크 (Potential Outcome Framework) 하에서 RAG 기반의 행동 선택을 공식화합니다. 2단계 방법에서, 벡터 검색 (Vector Search)은 임베딩 공간 (Embedding Space)에서 행동별 인접 증거를 검색하고, 생성기 (Generator)는 조건부 기대 결과 또는 그 차이를 추정하며, 플러그인 규칙 (Plug-in Rule)이 행동을 선택합니다. 이러한 공식화는 행동별 벡터 검색을 인과 추론 (Causal Inference)에서의 최근접 이웃 매칭 (Nearest-Neighbor Matching)과 연결합니다. 우리는 2단계 방법의 후회 (Regret)를 후보 생성 후회 (Candidate-generation Regret)와 후보 내 선택 후회 (Within-candidate Choice Regret)로 분해하며, 최근접 이웃 추정기 (Nearest-neighbor Estimators) 및 트랜스포머 (Transformers)를 위한 예측 오차 보장 (Prediction-error Guarantees)을 사용하여 후자를 제한합니다. 우리는 중간 계산 과정이 관찰되지 않기 때문에 1단계 방법을 정책으로서 직접 평가합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기