양에서 가치로: 온디바이스 RAG를 위한 선호도 정렬 메모리 구축
요약
온디바이스 AI 에이전트의 개인정보 보호와 응답성을 위해, 제한된 메모리 환경에서도 사용자 선호도를 효과적으로 반영할 수 있는 EPIC(Efficient Preference-aligned Index Construction) 기술을 제안합니다. EPIC은 원시 데이터에서 선호도 관련 정보만을 선택적으로 추출하여 인덱싱함으로써, 메모리 사용량을 획기적으로 줄이면서도 검색 정확도와 속도를 대폭 향상시킵니다.
핵심 포인트
- EPIC은 사용자 선호도를 압축된 개인적 문맥으로 간주하여 RAG 파이프라인에 통합하는 기술입니다.
- 기존 방식 대비 인덱싱 메모리 사용량을 최대 2,404배 절감할 수 있습니다.
- 선호도 준수 정확도(preference-following accuracy)를 20.17%p 향상시켰습니다.
- 가장 우수한 베이스라인 대비 검색 지연 시간을 33.33배 단축하여 온디바이스 환경에 최적화되었습니다.
- 1 MB 미만의 메모리 사용량과 29.35 ms/query의 낮은 지연 시간을 유지하며 스트리밍 업데이트가 가능합니다.
대규모 언어 모델 (LLMs) 기반의 개인용 AI 에이전트가 급격히 등장함에 따라, 개인정보 보호와 응답성을 위해 이를 온디바이스 (on-device) 환경에서 구현하는 것이 필수적이 되었습니다. 실제 세계의 요청이 가진 본질적인 개인적이고 문맥 의존적인 특성을 처리하기 위해, 이러한 에이전트는 기기에 상주하는 개인적 문맥 (personal context)에 기반하여 생성 작업을 수행해야 합니다. 그러나 제한된 메모리 예산 하에서, 핵심적인 병목 현상은 검색 (retrieval)이 사용자와 정렬된 상태를 유지할 수 있도록 무엇을 저장할 것인가 하는 문제입니다. 우리는 사용자 선호도를 압축적이고 안정적인 형태의 개인적 문맥으로 간주하고 이를 RAG 파이프라인 전반에 통합하는 EPIC (Efficient Preference-aligned Index Construction)을 제안합니다. EPIC은 원시 데이터에서 선호도와 관련된 정보를 선택적으로 유지하며, 검색이 선호도에 정렬된 문맥을 향하도록 조정합니다. 대화, 토론, 설명 및 추천을 다루는 4가지 벤치마크에 걸쳐, EPIC은 인덱싱 메모리를 2,404배 줄이고, 선호도 준수 정확도 (preference-following accuracy)를 20.17 퍼센트 포인트 향상시켰으며, 가장 성능이 뛰어난 베이스라인 대비 33.33배 낮은 검색 지연 시간 (retrieval latency)을 달성했습니다. 우리의 온디바이스 실험에서 EPIC은 스트리밍 업데이트 시 29.35 ms/query의 지연 시간을 유지하며 1 MB 미만의 메모리 사용량을 유지합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기