
RecGPT-V3 기술 보고서 (Technical Report)
요약
RecGPT-V3는 Taobao의 추천 시스템을 위해 설계된 상태 유지형 하이브리드 모달 모델입니다. Memory Hub, 하이브리드 모달 파운데이션 모델, 잠재 의도 추론 기술을 통해 계산 효율성을 높이고 추천 성능을 극대화했습니다.
핵심 포인트
- Memory Hub를 통해 사용자 모델링 계산량 55.8% 절감
- 시맨틱 ID(SIDs)와 자연어를 결합한 하이브리드 모달 추론 도입
- 잠재 의도 추론으로 출력 토큰 비용 200배 감소
- 실제 서비스 배포 결과 GMV 3.97% 상승 및 리소스 52.4% 절감
대규모 언어 모델 (LLMs)은 추천 시스템을 과거 행동의 공생 패턴을 매칭하는 방식에서, 그 행동을 유도하는 의도를 추론하는 방식으로 변화시키고 있습니다. RecGPT-V1은 사용자 이해를 중심으로 Taobao에서 이 패러다임을 개척했으며, RecGPT-V2는 조정된 멀티 에이전트 추론 (multi-agent reasoning)을 통해 이를 확장했습니다. 두 모델 모두 실제 서비스에 배포되어 사용자 경험과 상업적 성과 측면에서 지속적인 이득을 얻고 있습니다. 그러나 RecGPT를 대규모로 운영하면서 세 가지 과제가 드러났습니다: (1) 각 요청마다 전체 사용자 이력을 다시 처리하여 계산을 낭비하고 이전 분석을 버리는 무상태 행동 모델링 (stateless behavior modeling), (2) 자연어 태그가 사용자 이해와 아이템 접지 (item grounding) 사이에서 손실이 발생하는 채널을 형성하는 태그-아이템 정보 병목 현상 (tag-to-item information bottleneck), (3) 긴 사고 사슬 (chain-of-thought)로 인해 감당하기 어려운 지연 시간과 계산 오버헤드를 초래하는 비효율적인 명시적 추론 (explicit reasoning)입니다. 우리는 오픈 월드 지식을 위한 자연어와 구체적인 아이템 접지를 위한 시맨틱 ID (Semantic IDs, SIDs)를 사용하여 추론하는 상태 유지형 하이브리드 모달 (stateful, hybrid-modal) 추천 시스템인 RecGPT-V3를 제시합니다. Memory Hub는 장기적인 행동을 응축된 단위로 추출하여 구조화되고 지속적으로 진화하는 사용자 메모리를 유지하며, 이를 통해 사용자 모델링 계산량을 55.8% 절감합니다. 하이브리드 모달 파운데이션 모델 (Hybrid-modal Foundation Model)은 LLM이 텍스트 태그와 SIDs를 공동으로 추론할 수 있게 하여, 아이템 공간으로 향하는 고대역폭 채널을 개방합니다. 잠재 의도 추론 (Latent Intent Reasoning)은 장황한 근거들을 읽기 가능한 설명으로 디코딩 가능한 압축된 학습 가능 잠재 토큰 (learnable latent tokens)으로 내재화하여, 출력 토큰 비용을 200배 낮춥니다. Taobao의 "Guess What You Like" 피드에 배포된 RecGPT-V3는 대규모 온라인 A/B 테스트에서 IPV +1.28%, CTR +1.00%, TC +1.97%, GMV +3.97%의 지속적인 상승을 달성하는 동시에, 엔드-투-엔드 서빙 리소스 소비를 52.4% 절감했습니다. arXiv : https://arxiv.org/abs/2607.15591 Full Paper : https://arxiv.org/pdf/2607.15591 submitted by /u/pmttyji [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기