HBFlex: 미세한 LLM 상태와 거친 HBF 병렬 실행을 연결하는 유연 메모리 시스템
요약
본 논문은 LLM 서비스에 필요한 메모리 용량을 해결하기 위해 HBFlex라는 유연 메모리 시스템을 제안합니다. HBFlex는 KV 캐시의 읽기, 쓰기, 회수 과정에 최적화된 조정 기법을 적용하여 HBF의 평면 활용도를 개선했습니다. 이를 통해 기존 대비 높은 처리량 속도 향상을 달성하며 LLM 서비스 효율성을 높입니다.
핵심 포인트
- HBFlex는 KV 캐시 관리에 대한 조정 최적화를 적용한 메모리 시스템이다.
- 평면 활용도 개선을 위해 배치 및 어텐션 접근을 균형 있게 맞춘다.
- 쓰기-읽기 간섭을 줄여 전반적인 서비스 효율성을 높인다.
- FlashAccel 대비 최대 1.58배, H3 대비 3.30배의 처리량 향상을 보였다.
대규모 언어 모델(LLMs)은 증가하는 모델 가중치와 KV 캐시를 수용하기 위해 늘어나는 메모리 용량을 필요로 합니다. 고대역폭 플래시(High-Bandwidth Flash, HBF)는 대규모 평면 수준 병렬성을 통해 높은 메모리 밀도와 총 읽기 대역폭을 제공하여 LLM 서비스에 매력적인 옵션입니다. 하지만 LLMs를 전적으로 HBF에서 서비스하는 것은 세 가지 문제를 야기합니다: 미세한 KV 읽기는 배치 및 접근 불균형을 만들고, 증분 쓰기는 포그라운드 읽기를 방해하며, 혼합된 KV 수명 주기는 가비지 컬렉션을 증폭시킵니다. 하이브리드 HBM/HBF 설계는 동적 KV 관리를 지원하기 위해 HBM을 유지하지만, 이러한 할당은 고정된 패키징 예산 하에서 사용 가능한 HBF 리소스를 줄여 총 HBF 대역폭을 제한합니다. 본 논문에서는 KV 읽기, 쓰기 및 회수(reclamation)에 대한 조정 최적화가 적용된 완전한 HBF 메모리 시스템인 HBFlex를 제안합니다. HBFlex는 평면 활용도를 개선하기 위해 KV 배치와 어텐션 접근을 균형 있게 맞춥니다. 또한 증분 업데이트를 집계하고 쓰기백(writeback)을 충분히 긴 컴퓨팅 창 내에서 스케줄링하여 쓰기-읽기 간섭을 줄입니다. 아울러 수명 주도 블록 패킹과 지연된 회수를 결합하여 유효 페이지 마이그레이션을 감소시킵니다. 우리는 다양한 구성을 가로지르는 트레이스 기반 시뮬레이션을 통해 HBFlex를 평가합니다. HBFlex는 더 높은 HBF 대역폭과 동적 KV-캐시 읽기, 쓰기 및 삭제에 대한 더욱 효율적인 관리를 통해 FlashAccel 대비 최대 1.58$ imes$, H3 대비 3.30$ imes$의 평균 처리량 속도 향상을 달성합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기