다중 턴 에이전트 컨텍스트 감쇠 및 상태 오염 벤치마크
요약
본 글은 다중 턴 에이전트 시스템의 컨텍스트 감쇠 및 상태 오염 문제를 심층적으로 분석한 벤치마크 결과를 공유합니다. 기존의 선형 KV-cache나 평면 RAG 방식은 대화가 길어질수록 리콜률 저하(주제 누수) 문제가 발생했습니다. 반면, XORAS Poincaré Memory는 높은 정확도와 낮은 오염도를 유지하며 우수한 성능을 보였습니다.
핵심 포인트
- 다중 턴 에이전트의 컨텍스트 감쇠 및 상태 오염은 주요 문제입니다.
- 선형 KV-cache나 평면 RAG는 대화가 길어지면 리콜률 저하(주제 누수)를 겪습니다.
- XORAS Poincaré Memory 방식이 높은 정확도와 낮은 오염도를 유지하며 우수한 성능을 입증했습니다.
_Kaggle Benchmarking Challenge
제가 벤치마킹한 내용
50단계에 걸친 다중 턴 에이전트 컨텍스트 감쇠를 측정했습니다. 선형 KV-cache와 평면 RAG는 주제 누수(Peters' Rule)로 인해 리콜률이 97.2%에서 60.8%까지 떨어지는 문제가 발생했습니다.

그림 1: Apple M4에서 14-Gate BBQ 검증을 사용한 벤치마크 하네스.
테스트 모델
- XORAS 18,432-D Poincaré Memory
- Gemini 3.5 Pro
- Gemma-4 26B
- Flat Euclidean RAG
발견 사항

그림 2: 50단계에 걸친 정확도 리콜률.
- Flat RAG & Gemma-4: 상태 오염(state pollution)이 48.6%로 떨어지면서 정확도가 60.8%까지 하락했습니다.
- Gemini 3.5 Pro: 60.5%로 저하되었습니다.
- XORAS Poincaré Memory: 99.8%의 리콜률과 0.00%의 오염을 유지했습니다.

그림 3: POSIX SHM 3.16M ops/s 처리량 및 Z3 SMT 증명.
저의 벤치마크
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기