엣지 언어 모델을 위한 구조화된 메모리: O(1) SSM 상태 주입을 통한 지속적 컨텍스트 및 코퍼스 검색
요약
SSM의 특성을 활용하여 RAG의 프리필 비용을 O(1)로 줄이는 PRECOG 기술을 제안합니다. 문서 코퍼스를 은닉 상태로 사전 인코딩하여 컨텍스트 재수집 과정을 생략하며, 계층적 지속 메모리인 SMC를 통해 장단기 메모리 통합을 구현합니다.
핵심 포인트
- PRECOG를 통해 쿼리당 프리필 비용을 O(1)로 축소
- SSM 은닉 상태를 활용한 문서 코퍼스의 사전 인코딩 및 주입
- SMC를 통한 단기 에피소드 상태와 장기 의미 메모리의 통합
- 엣지 하드웨어에서 프리필 지연 시간을 약 4500배 단축
검색 증강 생성 (Retrieval-augmented generation, RAG)은 검색된 컨텍스트 길이에 비례하는 프리필 (prefill) 비용을 발생시키며, Transformer 백본을 사용할 경우 생성되는 각 토큰에 따라 증가하는 KV-캐시 (KV-cache) 비용을 수반합니다. 상태 공간 모델 (State-Space Models, SSMs)은 구조적으로 두 번째 비용을 방지합니다. 우리는 첫 번째 비용을 제거하여, 쿼리당 프리필 비용을 $O(L_{context})$에서 $O(1)$로 축소합니다. 우리는 SSM만의 고유한 특성을 활용하는 검색 메커니즘인 PRECOG (Pre-Computed Context Injection)를 소개합니다. 이 특성이란 고정된 크기이며 위치에 무관한(position-agnostic) 순환 은닉 상태 (recurrent hidden state)가 모델이 읽은 모든 것에 대한 완전한 요약이라는 점입니다. PRECOG는 문서 코퍼스 (document corpora)를 SSM 은닉 상태로 오프라인에서 사전 인코딩하며, 쿼리 시점에 가장 잘 일치하는 상태를 직접 주입함으로써 컨텍스트 내 재수집 (in-context re-ingestion) 과정을 완전히 우회합니다. 동일한 상태 주입 메커니즘은 SMC (Structured Memory Consolidation)를 가능하게 합니다. SMC는 인지 도메인 클러스터링 (cognitive-domain clustering), 조절 가능한 충실도 대 저장 용량 (fidelity-vs-storage) 다이얼, 그리고 $O(1)$ 세션 초기화를 갖춘 계층적 지속 메모리 (hierarchical persistent memory)로, 단기 에피소드 상태 (short-term episodic states)를 장기 의미 메모리 (long-term semantic memory)로 통합하고 쿼리 시점에 이를 검색된 코퍼스 상태와 융합합니다. 우리는 192 KB의 은닉 상태를 가진 1.2B 파라미터 게이트형 SSM (gated-SSM) 언어 모델인 TENNs-LLM에서 이 시스템을 입증합니다. PRECOG는 컨텍스트 내 RAG와 대등한 답변 품질을 유지하면서, 엣지 하드웨어에서 프리필 지연 시간을 ~27초에서 <6ms로 단축했습니다. 이는 사용 불가능한 수준에서 상호작용이 가능한 수준으로 넘어가는 임계점을 넘어서는 약 4500배의 속도 향상입니다. 이 메커니즘은 위치가 얽혀 있고(position-entangled) 컨텍스트 길이에 따라 선형적으로 증가하는 Transformer KV-캐시에서는 구조적으로 불가능합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기