Lachesis: 에이전트 서빙을 위한 HBM 및 고대역폭 플래시(HBF) 기반 수명 인식 KV 캐시 배치
요약
본 논문은 LLM 서빙 시 발생하는 막대한 KV 캐시 메모리 문제를 해결하기 위해 Lachesis라는 계층을 제안합니다. Lachesis는 KV 캐시의 수명(temporal, structural, inter-worker)에 따라 데이터를 HBM과 고대역폭 플래시(HBF)에 지능적으로 배치하여, 특히 HBF의 쓰기 내구성 한계를 극복하는 것이 핵심입니다.
핵심 포인트
- Lachesis는 KV 캐시 수명 기반으로 HBM/HBF 배치를 최적화합니다.
- 짧은 데이터는 HBM에, 긴 데이터는 HBF에 배치하여 효율을 높입니다.
- 이 방법을 통해 HBF의 수명을 획기적으로 연장할 수 있습니다 (최대 12.2 장치년).
- 에이전트 하네스 동작 분석을 통해 수명 분기 축을 식별했습니다.
거대 언어 모델(LLM) 서빙은 점점 더 에이전트 워크로드에 의해 지배되고 있으며, 이 과정에서 에이전트와 그 하위 에이전트들은 여러 요청에 걸쳐 컨텍스트를 KV 캐시로 축적하며 막대한 메모리를 소모합니다. 고대역폭 플래시(HBF)는 HBM급 읽기 대역폭으로 한 자릿수 더 큰 용량을 제공하는 유망한 해결책이지만, 그 유한한 쓰기 내구성이 핵심적인 제한 요소입니다. 우리의 핵심 통찰은 KV 캐시가 수명에 따라 HBM과 HBF 모두에 배치되어야 한다는 것입니다. 짧게 살아있는 데이터를 HBM에 배치하면 HBM이 에이전트 실행의 더 많은 쓰기를 흡수할 수 있게 하고, HBF로 보내는 쓰기 양을 줄일 수 있습니다. 에이전트 서빙에서 KV 캐시의 수명은 에이전트를 오케스트레이션(orchestrate)하는 프로그램인 하네스(harness)에 의해 결정되므로, 우리는 그 동작을 분석하고 수명이 분기되는 세 가지 축, 즉 시간적(temporal), 구조적(structural), 그리고 워커 간(inter-worker)의 축을 식별합니다. 이러한 관찰을 바탕으로, 우리는 에이전트 하네스와 서빙 엔진 사이에 위치하는 수명 인식 KV 캐시 배치 계층인 Lachesis를 제안합니다. 쓰기 시점에, 이는 각 세그먼트를 그 수명에 따라 HBM 또는 HBF에 배치하고, 해당 세그먼트가 더 이상 읽히지 않을 때 블록을 해제합니다. 트레이스 기반 시뮬레이션에서, Lachesis는 HBM 우선 배치 대비 1.193.13배로 HBF 수명을 연장하여 3.312.2 장치년(device-years)에 도달합니다. 심지어 최대 부하의 연속적인 24시간 7일 운영에서도, 엄격한 서비스 수준 목표(SLO)를 유지할 경우, HBF는 다중 에이전트 트레이스에서 5년 보증 기간을 초과하여 사용될 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기