CALMRec: 장기적 추천을 위한 인과적 정렬 언어 메모리
요약
CALMRec은 LLM 기반 추천 시스템이 사용자의 지속적 선호와 일시적 의도를 구분하지 못하는 문제를 해결하기 위한 프레임워크입니다. 멀티모달 언어 모델을 활용해 단기, 장기, 노출 메모리를 분리하여 관리하며, 노출 편향을 줄이고 장기적 가치를 극대화합니다.
핵심 포인트
- 사용자 선호, 의도, 노출 행동을 분리하는 메모리 구조 제안
- 성향 가중 업데이트를 통해 정책 유도 노출 편향 완화
- 보수적 오프라인 비평가로 지연된 만족도를 고려한 재순위화 수행
- 이커머스, 뉴스, 숏폼 환경에서 장기 가치(LTV) 개선 입증
대규모 언어 모델 (LLMs)은 이질적인 사용자 증거를 자연어로 요약할 수 있지만, 현재의 LLM 추천 시스템은 지속적인 선호도 (enduring preferences), 일시적인 의도 (transient intent), 그리고 노출로 유도된 행동 (exposure-induced behavior)을 하나의 프로필로 붕괴시키는 경우가 많습니다. 이는 추천 시스템을 피드백 루프 (feedback loops)에 취약하게 만듭니다. 즉, 반복적인 노출이 선호도로 오인되고, 즉각적인 클릭이 지연된 만족도를 압도하며, 유창한 설명이 반드시 순위 결정 (ranking decision)을 반영해야 하는 것은 아닙니다. 우리는 장기적 추천 (long-horizon recommendation)을 위한 모델 불가지론적 (model-agnostic) 프레임워크인 우리의 방법을 제안합니다. 우리의 방법은 동결된 멀티모달 언어 모델 (frozen multimodal language model)을 사용하여 아이템 콘텐츠와 피드백을 증거에 기반한 의미론적 원자 (evidence-grounded semantic atoms)로 변환한 다음, 별도의 단기, 장기 및 노출 메모리를 유지합니다. 성향 가중 업데이트 (Propensity-weighted updates)는 정책 유도 노출 편향 (policy-induced exposure bias)을 줄이며, 보수적인 오프라인 비평가 (conservative offline critic)는 행동 지원 제약 (behavior-support constraint) 하에서 지연된 만족도를 위해 후보군을 재순위화 (reranks)합니다. 설명은 영향력 있는 증거 원자만을 사용하며 반사실적 삭제 (counterfactual deletion)를 통해 검증됩니다. 우리는 식별 결과 (identification result)를 제공하며 이커머스형, 뉴스형, 숏폼 비디오형 환경에서 프레임워크를 평가합니다. 10개의 시드 (seeds) 전체에 걸쳐, 우리의 방법은 가장 강력한 대안보다 할인된 장기 가치 (discounted long-term value)를 각각 6.1%, 7.6%, 6.7% 개선했습니다. 20개 시드 쌍 ablation 연구 결과, 성향 교정 (propensity correction) (0.739 +/- 0.191) 또는 보수적 지원 정규화 (conservative support regularization) (0.523 +/- 0.234)를 제거한 후 상당한 가치 하락이 나타났습니다. 또한 동결된 지시 언어 모델 (frozen instruction language model)은 홀드아웃 패러프레이즈 벤치마크 (held-out paraphrase benchmark)에서 TF-IDF 대비 의미론적 원자 NDCG를 두 배 이상 높였습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기