LLM 서빙을 위한 고대역폭 플래시 특성 분석
요약
LLM 서빙 시 메모리 용량과 대역폭이 병목 현상을 일으키면서, 고대역폭 플래시(HBF)를 활용한 계층적 저장 시스템의 필요성이 커지고 있습니다. 본 연구는 HBM-HBF-호스트 구조와 버퍼 캐시 인식 스케줄링을 도입하여 성능, 에너지 효율성, 그리고 HBF 쓰기 수명에 미치는 영향을 분석했습니다. 그 결과, HBF 증강 시스템은 완료 시간을 크게 단축하고 에너지 절감 효과를 가져오며, 적절한 스케줄링으로 HBF의 수명을 연장할 수 있음을 입증했습니다.
핵심 포인트
- HBF는 LLM 서빙 성능 향상에 기여하는 확장 메모리 솔루션이다.
- HBM-HBF-호스트 구조와 버퍼 캐시 인식 스케줄링이 효과적이다.
- HBF 증강 시스템은 완료 시간을 최대 87.0%까지 단축시킨다.
- 스케줄링 최적화는 HBF의 쓰기 수명을 실질적으로 연장한다.
거대 언어 모델(LLM) 서빙은 모델 가중치와 KV 캐시를 저장하는 데 상당한 메모리를 필요로 합니다. 모델이 커지고 컨텍스트가 길어짐에 따라, 메모리 용량과 대역폭은 서비스 성능의 병목 현상이 되어가고 있습니다. 에이전트 워크로드(Agentic workloads)는 성장하는 컨텍스트를 넘나드는 반복적인 상호작용을 통해 이러한 압력을 가중시키며, KV 상태를 재사용하기 위해 유지하는 것이 점점 더 중요해지고 있습니다. 고대역폭 플래시(HBF: High-bandwidth flash)는 LLM 서빙을 위한 가속기 메모리 용량을 확장할 수 있는 방법을 제공하지만, 접근 비용과 제한된 쓰기 내구성 때문에 사용이 복잡합니다. 우리는 시스템 설계 및 스케줄링 선택 전반에 걸쳐 HBF를 평가하여, 추가적인 용량이 언제 서비스 성능과 에너지 효율성을 개선하는지 이해하고자 합니다. 우리는 HBM-HBF-호스트 계층적 저장 시스템과 버퍼 캐시 인식 스케줄링을 도입하고, 트레이스 기반 시뮬레이션을 사용하여 이들이 성능, 에너지 소비, 그리고 HBF 쓰기 수명에 미치는 영향을 분석합니다. 평가된 워크로드 전반에 걸쳐, 가장 빠른 HBF 증강 시스템은 HBM만 사용한 시스템 대비 완료 시간을 36.1%에서 87.0%까지 단축시킵니다. 모델링된 에너지 절감량은 55.8%에 달하지만, 일부 가벼운 워크로드에서는 HBF가 에너지 소비를 증가시키기도 합니다. 버퍼 캐시 인식 스케줄링은 평가된 구성에서 예상되는 HBF 쓰기 수명을 4.77년에서 14.82년으로 연장합니다. 이러한 결과는 서비스 효율성을 개선하는 동시에 실용적인 HBF 쓰기 수명을 유지하기 위해 데이터 배치와 스케줄링을 조정하는 것의 중요성을 입증합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기