요청 순서가 중요하다: 로링 에이전트의 선택적 KV-캐시 재사용에서 캐시-히스토리 민감도
요약
본 논문은 장시간 실행되는 로링 에이전트 워크로드에서 KV-캐시의 선택적 재사용에 대한 캐시-히스토리 민감도를 분석했습니다. 기존 방식으로는 요청 순서가 답변 변동성을 크게 야기할 수 있음을 보여주었습니다. 문서 정렬형 재계산 기법은 이러한 변동성을 현저히 줄이고, 전체 프리필 충실도를 높이며, TTFT 속도 향상에도 기여함을 입증했습니다.
핵심 포인트
- 로링 에이전트에서 KV-캐시 재사용 시 요청 순서에 따른 답변 변동성이 발생할 수 있다.
- 문서 정렬형 재계산은 요청 순서별 답변 변동성을 69.0%에서 26.1%로 크게 감소시킨다.
- 해당 기법은 전체 프리필 충실도를 높이고, TTFT 속도 향상에도 효과적이다.
- 워크로드의 연속성(contiguity)이 선택적 재계산의 핵심 요소임을 확인했다.
장시간 실행되는 에이전트는 문서 창의 대부분을 유지하면서 LLM을 반복적으로 호출하고, 오래된 문서를 제거하며 새로운 문서를 추가합니다. 이러한 로링 업데이트는 정확한 접두사(prefix) 캐싱을 깨뜨리며 선택적 재계산(selective recomputation)을 통한 비접두사 KV-캐시 재사용을 필요로 합니다. 우리는 지속적인 KV-캐시 재사용이 선택적 재계산을 통해 히스토리 의존적일 수 있음을 보여줍니다: 우리의 로링 에이전트 워크로드에서, 변경되지 않은 프롬프트가 그 앞에 처리된 요청에 따라 다른 답변을 생성할 수 있습니다. 5%의 일치하는 재계산 예산(recomputation budget)에서, 문서 정렬형 재계산은 CacheBlend의 토큰 top-$k$ 정책을 사용했을 때의 요청 순서별 답변 변동성 69.0%를 26.1%로 줄입니다. 각 프롬프트가 다른 일련의 선행 요청들 이후에 평가될 때, 문서 정렬형 재계산은 토큰 top-$k$ 대비 전체 프리필(full prefill)에 대한 충실도를 34.5~52.5 퍼센트 포인트 향상시키며, 두 정책 모두 약 5.7$ imes$의 중앙 TTFT 속도 향상을 달성합니다. 우리의 제거 연구(ablation study)는 로링 에이전트 워크로드에서 연속성(contiguity)이 견고한 선택적 재계산과 관련된 주요 요소임을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기