장기 생존 캐릭터의 로컬 추론: 게임 NPC를 위한 증분 메모리 유지
요약
본 논문은 게임 NPC의 장기 생존 캐릭터를 위한 증분 메모리 유지 방식을 연구했습니다. 로컬 배포 언어 모델 기반 캐릭터는 대화마다 전체 기억을 재처리해야 하는 비효율성이 있습니다. 제안된 런타임은 사용되지 않는 어텐션 KV 엔트리를 제거하고, 지속되는 순환 상태와 변경되지 않은 KV를 보존하여 메모리 유지 비용을 절감합니다.
핵심 포인트
- NPC의 장기 생존을 위해 증분 메모리 유지가 필수적입니다.
- 사용하지 않는 어텐션 KV 엔트리를 제거하는 런타임이 제안되었습니다.
- 캐릭터 상태는 단순한 텍스트가 아닌 역사 의존 자원으로 다루어져야 합니다.
게임 캐릭터는 대화할 때마다 자신의 전체 삶을 다시 읽을 필요가 없어야 합니다. 하지만 로컬에 배포된 언어 모델 기반 캐릭터의 경우, 몇 가지 기억만 수정해도 길게 재사용 가능한 접두사(prefix)를 무효화시킬 수 있습니다. 그 결과 발생하는 준비 비용은 전경 대화와 다른 캐릭터들의 메모리 유지 비용과 경쟁합니다. 이는 특히 대화가 게임 정의 행동이나 가치 판단에 영향을 미치는 경우 중요합니다. 예를 들어, 어떤 아이템의 소유권이 누구에게 있는지, 또는 이전 전송이 이미 발생했는지에 대한 유창하지만 잘못된 설명은 그렇지 않으면 결정론적인 규칙(deterministic rules)으로 들어가는 입력을 오염시킬 수 있습니다. 우리는 양자화된 Qwen 하이브리드 순환-어텐션 모델을 사용하여 장기 생존 게임 NPC를 위한 증분 메모리 유지 방식을 연구합니다. 우리의 런타임은 더 이상 사용되지 않는 어텐션 KV 엔트리를 제거하고, 실제 시퀀스 끝(sequence tail)에서 대체 기록을 계산하며, 지속되는 순환 상태와 변경되지 않은 KV를 보존합니다. 기존의 로컬 실험들은 다중 업데이트 대화 리플레이(multi-update dialogue replays), 고정 입력 배치 제거(fixed-input placement ablations), 그리고 어텐션 진단(attention diagnostics)을 결합했습니다. 독립적인 블록 구성은 균일한 청크 초기 어텐션 붕괴 없이 질의 조건부 메모리 선택을 약화시킵니다. 실제 끝 업데이트는 여덟 번의 스크립트된 유지 라운드에 걸쳐 중요한 현재 상태 및 역사적 바인딩을 보존합니다. 배치(placement) 사례는 세 번의 재구성을 통해 전체 채움 양(full-refill quantity)을 회복하는 반면, 슬롯 보존 대안들은 이중 차감 오류를 반복합니다. 어텐션 분포 근접성만으로는 이러한 의미론적 차이를 설명할 수 없습니다. 이 결과들은 캐릭터의 추론 상태를 단지 최신 메모리 텍스트의 폐기 가능한 인코딩이 아니라, 유지되고 역사에 의존하는 자원(history-dependent resource)으로 다루어야 함을 시사합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기