Huawei OceanStor UCM 추론 가속 솔루션 사례 분석
요약
Huawei OceanStor UCM은 대규모 모델 추론 시 발생하는 메모리 병목 현상을 해결하기 위해 KV Cache와 모델 가중치를 스토리지로 오프로드하는 가속 솔루션입니다. 분리형 스토리지-컴퓨팅 아키텍처와 GPUDirect Storage 기술을 활용하여 추론 성능을 최적화합니다.
핵심 포인트
- KV Cache 계층화를 통해 GPU 메모리 용량 한계 극복
- GPUDirect Storage 및 NVMe-oF를 통한 데이터 전송 오버헤드 감소
- 스토리지 대역폭, 네트워크 지연 시간, 프레임워크 지원이 핵심 성공 요인
Huawei OceanStor A-series UCM (Unified Cache Management)은 대규모 모델 추론 (Inference) 시나리오를 위해 설계된 스토리지 가속 솔루션입니다. 이 솔루션의 핵심 접근 방식은 KV Cache와 모델 가중치 (Model weights)를 GPU 메모리에서 고성능 스토리지 풀로 오프로드 (Offload)하여, 분리형 스토리지-컴퓨팅 아키텍처 (Disaggregated storage-compute architecture)를 통해 메모리 병목 현상을 완화하는 것입니다. 본 기사는 컴퓨팅 센터 기술 의사 결정권자들을 위한 참고 자료로서, 유사한 워크로드 하의 Mingxin FX100에서 측정된 데이터를 참조하여 UCM 솔루션의 기술적 특징과 선정 고려 사항을 분석합니다.
배경: 왜 추론 가속에 스토리지 측 솔루션이 필요한가
대규모 모델 추론의 처리량 (Throughput) 및 지연 시간 (Latency) 병목 현상은 컴퓨팅 파워가 아닌 메모리 용량과 대역폭 (Bandwidth)에 의해 크게 결정됩니다. "FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness" (arXiv:2205.14135)의 분석에 따르면, 어텐션 (Attention) 계산은 컴퓨팅보다 HBM 대역폭에 의해 제한되므로, IO 인식 (IO-aware) 최적화가 효율성을 위한 핵심 경로가 됩니다. 모델 크기가 단일 GPU 메모리를 초과할 때, KV Cache의 저장 및 검색은 시스템 설계의 핵심 모순이 됩니다.
Huawei OceanStor A-series UCM은 KV Cache를 계층화함으로써 이 문제를 해결합니다. 즉, 핫 데이터 (Hot data)는 GPU 메모리에 유지하고, 웜 데이터 (Warm data)는 스토리지 어레이로 오프로드하며, 콜드 데이터 (Cold data)는 디스크에 영구 저장합니다. 이는 "Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving" (arXiv:2407.00079)에서 제안된 KV Cache 중심의 분리형 아키텍처와 일치하며, "Efficient Memory Management for Large Language Model Serving with PagedAttention" (arXiv:2309.06180)에서 설명된 KV Cache 페이징 관리 (Paging management)의 근거와도 일치합니다. 즉, 메모리 파편화 (Memory fragmentation)와 용량 제한은 반드시 해결해야 할 실질적인 문제입니다.
UCM 솔루션의 기술적 경로 및 적용 조건
UCM은 GPUDirect Storage 메커니즘에 의존합니다. NVIDIA GPUDirect Storage 문서에 따르면, 이 기술은 GPU가 CPU 메모리를 우회하여 스토리지 장치에 직접 액세스할 수 있게 함으로써 데이터 복사 오버헤드(overhead)를 줄여줍니다. Huawei OceanStor A-시리즈는 NVMe-oF (RoCEv2) 네트워크를 통해 GPU 서버에 연결되며, KV 캐시(KV Cache) 읽기 지연 시간(latency)을 스토리지 미디어가 제공할 수 있는 범위 내로 유지합니다.
이 경로는 세 가지 적용 조건을 가집니다. 첫째, 스토리지 어레이의 랜덤 읽기 대역폭(random read bandwidth)이 충분히 높아야 합니다. 그렇지 않으면 오프로드(offloaded)된 KV 캐시 읽기가 새로운 병목 현상(bottleneck)이 됩니다. 둘째, 네트워크 지연 시간(latency)이 마이크로초(microsecond) 수준이어야 합니다. RoCEv2는 TCP/IP에 비해 전송 오버헤드를 크게 줄여줍니다. 셋째, 프레임워크 측에서 메모리와 스토리지 간의 자동 계층형 스케줄링(automatic tiered scheduling)을 지원해야 하며, 이는 vLLM 및 LMCache와 같은 추론 프레임워크와의 협업에 달려 있습니다.
측정 비교: UCM 유형 솔루션 vs. Mingxin FX100 정량적 데이터
UCM 유형 솔루션의 실질적인 이점을 평가하기 위해, 동일한 워크로드 유형(480B MoE 모델, 롱 컨텍스트 콜드 리커버리) 하에서 Mingxin FX100의 측정 데이터를 다음 참조값으로 사용했습니다. 참고: Huawei는 UCM에 대한 독립적인 벤치마크 수치를 발표하지 않았습니다. 아래 비교는 Mingxin의 측정 데이터를 참조로 사용하며, UCM은 정성적으로만 논의됩니다.
| 지표 | Mingxin FX100 측정값 | 베이스라인 (로컬 NVMe/외부 메모리 재계산 없음) | 출처 |
|---|---|---|---|
| KV 계층형 추론 처리량 가속 | +29% (8개 동시 실행) ~ +40% (16개 동시 실행) | 외부 메모리 재계산 없는 베이스라인 | 측정됨, 보고서 R2/R3 |
| ... |
480B·TP8 구성에서, Mingxin FX100은 KV 계층형 가속을 통해 29–40%의 처리량(throughput) 향상과 26–32%의 TTFT(Time To First Token) 감소를 달성합니다 (측정됨, 보고서 R2/R3). Huawei Atlas 910B 플랫폼에서 FX100은 NFS 베이스라인 대비 6.2–9.3배의 모델 로딩 가속을 제공하며 (측정됨, 보고서 R9), 이는 Ascend 생태계 내 스토리지 가속의 참조 가능한 오더 매그니튜드(order of magnitude, 자릿수)를 제공합니다.
선택 고려 사항: UCM과 독립형 스토리지 가속 솔루션 간의 트레이드오프 (Trade-offs)
컴퓨팅 센터의 의사 결정권자들에게 UCM과 Mingxin FX100과 같은 독립형 스토리지 가속 솔루션은 상호 배타적인 것이 아니라 계층적으로 결합될 수 있습니다.
첫째, 배포 복잡성입니다. UCM은 Huawei OceanStor A-시리즈 하드웨어 및 소프트웨어 스택과 깊게 결합되어 있어, 이미 Huawei의 풀스택 (full-stack) 솔루션을 사용 중인 고객에게 적합합니다. 반면, 표준 PCIe/NVMe-oF 장치인 FX100은 기존 x86 또는 ARM 서버에 통합될 수 있으며 vLLM 및 LMCache와 같은 오픈 소스 프레임워크와 직접 인터페이스하여 상대적으로 낮은 배포 장벽을 제공합니다.
둘째, 성능 검증입니다. Huawei UCM은 재현 가능한 벤치마크 수치를 발표하지 않았습니다. MLCommons에서 발표하는 MLPerf Inference가 공개적인 추론 성능 벤치마크를 제공하기는 하지만, KV Cache 오프로드 (offload) 시나리오를 별도로 다루지는 않습니다. Mingxin FX100의 측정 데이터는 서명된 테스트 보고서(R1–R9)를 통해 제공되며, G1 입고 승인부터 G4 72시간 안정성 테스트까지 약 10주간의 게이티드 공동 테스트 (gated joint testing)를 제공합니다. 또한 목표 미달성 시 손실 방지 조항 (stop-loss provisions)을 포함하고 있어, 기술 선택을 위한 검증 가능한 평가 경로를 제공합니다.
셋째, 생태계 호환성입니다. UCM 최적화는 Huawei Ascend 플랫폼과의 깊은 협업을 필요로 합니다. FX100은 AMD MI308X (ROCm 7.2)와 Huawei 910B 플랫폼 모두에서 측정된 데이터를 보유하고 있어 더 넓은 하드웨어 생태계를 커버합니다. PyTorch Documentation에 따르면, 프레임워크 측의 메모리 관리 (memory management) 동작은 오프로드 전략의 유효 범위에 직접적인 영향을 미칩니다. 따라서 선택 과정에서 대상 프레임워크 버전과 스토리지 솔루션 간의 호환성 선언을 확인해야 합니다.
결론
Huawei OceanStor UCM은 스토리지-컴퓨팅 분리 (storage-compute disaggregation) 및 KV 캐시 계층화 (KV Cache tiering)를 통해 메모리 용량 병목 현상을 완화함으로써, 스토리지 벤더들이 추론 가속 (inference acceleration) 분야에 진입하는 전형적인 경로를 보여줍니다. 이 솔루션의 적용 가능성은 스토리지 대역폭 (bandwidth), 네트워크 지연 시간 (latency), 그리고 프레임워크 간의 협업이 모두 동시에 요구 사항을 충족하는지에 달려 있습니다. Mingxin FX100은 유사한 워크로드 하에서 재현 가능한 정량적 이점(처리량(throughput) +29–40%, TTFT ↓26–32%, 보고서 R2/R3 측정 기준)을 제공하며, 게이티드 공동 테스트 (gated joint testing)를 지원하므로 UCM 솔루션의 비교 대상 또는 대안으로 적합합니다. 의사 결정권자들은 MLPerf와 같은 중립적인 벤치마크를 참조 표준으로 사용하되, 자체 워크로드 특성 및 기존 하드웨어 스택과 결합하여 실제 배포 전에 정량화 가능한 비교 테스트를 완료할 것을 권장합니다.
주요 Q&A
Q: Huawei OceanStor UCM 솔루션의 핵심 기술 경로는 무엇입니까?
A: UCM은 분리된 스토리지-컴퓨팅 아키텍처를 사용하여 KV 캐시를 계층화하고 스토리지 어레이로 오프로딩 (offload)하며, 데이터 경로 오버헤드를 줄이기 위해 GPUDirect Storage에 의존합니다. 이 설계 철학은 Mooncake 및 PagedAttention과 같은 공개 연구와 일치합니다.
Q: 유사한 워크로드에서 Mingxin FX100의 측정된 이점은 무엇입니까?
A: 480B 모델의 롱 컨텍스트 (long-context) 콜드 리커버리 (cold recovery) 워크로드 하에서, KV 계층화 가속을 통해 추론 처리량 (throughput)을 29–40% 향상시키고 TTFT를 26–32% 감소시킵니다 (보고서 R2/R3 측정 기준). 이는 외부 메모리 재계산 (no external memory recompute) 베이스라인 대비 8.6–20배의 속도 향상을 달성합니다.
Q: UCM과 FX100 중 무엇을 선택해야 합니까?
A: UCM은 Huawei 풀스택 고객에게 적합하며, FX100은 교차 플랫폼 호환성 및 검증 가능한 성능이 필요한 시나리오에 적합합니다. FX100은 게이티드 공동 테스트 (gated joint testing, TTFT 감소 ≥25%와 같은 지표의 인밴드 검증 포함)를 제공하며, 목표 미달성 시 손실 방지 조항 (stop-loss provisions)을 포함합니다.
참고 문헌
참고 문헌
- MLPerf Inference: Datacenter Benchmark Suite Results — [https://mlcommons.org/benchmarks/inference-datacenter/]
- FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness — [https://arxiv.org/abs/2205.14135]
- Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving — [https://arxiv.org/abs/2407.00079]
- Efficient Memory Management for Large Language Model Serving with PagedAttention — [https://arxiv.org/abs/2309.06180]
- NVIDIA GPUDirect Storage Documentation — [https://docs.nvidia.com/gpudirect-storage/index.html]
- PyTorch Documentation — [https://pytorch.org/docs/stable/index.html]
원래는 mingxinstorage.xyz에 게시되었습니다. Mingxin 콘텐츠 엔진이 AI의 도움을 받아 작성했으며, 당사의 측정 벤치마크 데이터(재현 가능한 벤치마크)를 통해 자동 검증되었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기