D-NOVA: 벡터 적응을 통한 Dual-Bound 3D NAND 최적화 유사도 검색 기반의 인-스토리지(In-Storage) 검색 가속기
요약
RAG의 병목 현상인 밀집 벡터 검색을 해결하기 위해 하드웨어-소프트웨어 공동 설계된 인-스토리지 가속기 D-NOVA를 제안합니다. NAND 메모리 내부에 검색 기능을 직접 통합하여 데이터 이동을 최소화하고 에너지 효율을 극대화했습니다.
핵심 포인트
- NAND 메모리 어레이에 검색 기능을 직접 내장한 D-NOVA 제안
- Dual-Bound Tight Similarity Sensing(DTS) 기술로 검색 가속화
- 경량 대조 어댑터를 통해 성능과 재현율을 동시에 확보
- CPU 대비 최대 41.7배 빠른 속도와 71배 높은 에너지 효율 달성
검색 증강 생성 (Retrieval-Augmented Generation, RAG)은 외부 지식 베이스에서 관련 정보를 검색함으로써 대규모 언어 모델 (Large Language Model, LLM) 추론의 사실적 근거를 강화합니다. 그러나 밀집 벡터 (dense vector) 검색은 상당한 지연 시간과 에너지 오버헤드를 유발하여 주요 성능 병목 현상이 됩니다. 최근의 인-스토리지 (in-storage) 가속기들이 데이터 이동을 줄이는 것을 목표로 하고 있지만, 이들은 여전히 메모리 외부의 호스트 또는 임베디드 프로세서에 의존하고 있으며, 전체 검색 시간의 거의 70%가 여기서 소모됩니다. 결과적으로 이들은 대역폭 제한을 완전히 극복하지 못해 또 다른 메모리 병목 현상을 초래합니다. 이러한 한계를 해결하기 위해, 우리는 하드웨어-소프트웨어 공동 설계된 인-스토리지 검색 가속기인 D-NOVA를 제안합니다. D-NOVA는 검색 기능을 NAND 메모리 어레이에 직접 깊이 내장함으로써 역 색인 파일 (Inverted File, IVF) 기반의 계층적 검색 파이프라인을 실행합니다. 이는 NAND 스트링 내 검색에 특화된 새로운 거리 측정 방식인 Dual-Bound Tight Similarity Sensing (DTS)를 통합함으로써 달성됩니다. 또한, 임베딩 벡터를 DTS 친화적인 도메인으로 매핑하는 경량 대조 어댑터 (contrastive adapter)를 도입하여, 성능과 에너지 효율을 개선하는 동시에 소프트웨어 수준에 근접한 재현율 (recall)을 회복합니다. D-NOVA는 CPU 베이스라인보다 최대 41.7배 빠르고 71배 더 에너지 효율적이며, 최첨단 인-스토리지 RAG 가속기보다 처리량은 12.13배 더 높으면서 에너지 효율은 최대 1.26배 더 높습니다. 이는 확장 가능한 RAG 가속을 위한 완전한 인-스토리지 벡터 검색의 잠재력을 입증합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기