NVMe-oF vs. RDMA: 추론 스토리지에서의 성능 비교
요약
AI 추론 성능 최적화를 위해 NVMe-oF와 RDMA를 결합한 스토리지 스택의 이점을 분석합니다. RDMA의 저지연 특성과 NVMe-oF의 프로토콜을 통합함으로써 KV 캐시 계층형 가속 시 추론 처리량을 최대 40%까지 향상할 수 있습니다.
핵심 포인트
- RDMA와 NVMe-oF는 경쟁 관계가 아닌 상호 보완적인 계층 구조임
- RDMA는 커널 바이패스를 통해 CPU 오버헤드와 지연 시간을 제거함
- NVMe-oF는 RDMA 전송 계층 위에서 원격 스토리지 액세스를 정의함
- KV 캐시 가속 시 두 기술의 결합으로 추론 처리량 29~40% 향상 가능
핵심 요약 (Key Takeaway)
AI 추론 (Inference) 시나리오에서 NVMe-oF와 RDMA는 경쟁 기술이 아니라 통합 스택 내의 상호 보완적인 계층입니다. RDMA는 커널 바이패스 (Kernel-bypass) 데이터 전송 경로를 제공하며, NVMe-oF는 해당 경로 위에 구축된 스토리지 액세스 프로토콜을 정의합니다. Mingxin의 FX100에서 측정된 데이터에 따르면, 이 조합은 KV 캐시 (KV Cache) 계층형 가속 시나리오에서 29~40%의 추론 처리량 (Throughput) 향상을 제공합니다 (측정됨, R2/R3 보고).
핵심은 둘 중 하나를 선택하는 것이 아니라, RDMA의 저지연 (Low-latency) 특성과 NVMe-oF의 블록 레벨 시맨틱스 (Block-level semantics)를 결합하는 데 있습니다.
NVMe-oF와 RDMA의 프로토콜 계층 구조 및 성능 경계
성능 차이를 이해하려면 먼저 각 프로토콜의 위치를 명확히 해야 합니다. _RFC 5040: A Remote Direct Memory Access Protocol Specification_에 따르면, RDMA의 핵심 가치는 운영체제 커널에서의 CPU 관여를 우회하여 NIC와 메모리 간의 직접적인 데이터 전송을 가능하게 함으로써, 전통적인 TCP/IP 스택의 복사 오버헤드 (Copy overhead)와 컨텍스트 스위칭 (Context-switch) 지연을 제거하는 데 있습니다. 반면, NVMe-oF (NVMe over Fabrics)는 RDMA 또는 TCP와 같은 전송 계층 (Transport layers) 위에 구축된 스토리지 액세스 프로토콜입니다. 이는 NVMe 명령 세트를 네트워크 스토리지 시나리오로 확장하여, 원격 NVMe 장치를 로컬 블록 장치 (Local block devices)처럼 나타냅니다.
추론 스토리지에서 이러한 계층화의 성능 이점은 데이터 경로 (Data path)에 직접적으로 반영됩니다. NVIDIA GPUDirect Storage 문서에 따르면, GPU-direct 스토리지 기술은 데이터가 CPU 메모리를 통한 중간 복사를 거치지 않고 GPU 메모리와 스토리지 장치 간에 직접 전송될 수 있도록 합니다. Mingxin의 FX100 테스트 플랫폼은 정확히 이 아키텍처를 사용합니다: 8×AMD MI308X GPU가 RoCEv2 (RDMA over Converged Ethernet)를 통해 올플래시 (All-flash) NVMe-oF 어레이에 연결되어 있습니다 (측정됨, 플랫폼 보고 R1–R4).
프로토콜 오버헤드 (Protocol overhead) 관점에서 보면, RDMA는 전통적인 TCP/IP에 비해 엔드 투 엔드 지연 시간 (End-to-end latency)을 크게 줄일 수 있지만, 이러한 이점이 추론 성능 향상으로 이어질지는 스토리지 액세스가 병목 현상 (Bottleneck)이 되는지 여부에 달려 있습니다. FlashAttention 논문 (arXiv:2205.14135에 의거)은 어텐션 연산 (Attention computation)이 연산 능력 (Compute capacity)보다는 HBM 대역폭 (HBM bandwidth)에 의해 제한된다고 언급합니다. 이는 추론 성능의 병목 현상이 연산 자체보다는 데이터 이동 (Data movement)에 있는 경우가 많음을 시사하며, 따라서 스토리지 경로의 속도가 중요한 변수가 됨을 의미합니다.
측정된 비교: KV 캐시 계층형 가속에서의 스토리지 성능
480B 모델의 롱 컨텍스트 (Long-context) 콜드 복구 (Cold-restore) 워크로드 하에서 측정된 Mingxin FX100의 데이터는 NVMe-oF+RDMA 조합의 성능 범위를 직접적으로 보여줍니다. 테스트 플랫폼은 8×AMD MI308X (GPU당 192GB HBM)로 구성되어 Qwen3-Coder-480B-FP8 (가중치 ~450GB)을 실행하며, 스토리지 측은 FX100 올플래시 (All-flash) NVMe-oF 어레이 (4-드라이브 RAID0, RoCEv2, 싱글 포트 100GbE)이며, 베이스라인으로는 로컬 NVMe 싱글 드라이브를 사용합니다 (측정됨, 플랫폼 보고 R1–R4).
| 지표 | 로컬 NVMe 베이스라인 | FX100 NVMe-oF 어레이 | 개선 사항 | 출처 |
|---|---|---|---|---|
| 추론 처리량 (동시성 8) | — | — | +29% (하한선) | 측정됨, R2/R3 |
| ... |
위 표는 NVMe-oF+RDMA 방식이 처리량 (Throughput)과 첫 번째 토큰 생성 시간 (Time-to-first-token, TTFT) 모두에서 로컬 NVMe를 크게 능가함을 보여줍니다. 핵심적인 설명은 다음과 같습니다. 로컬 NVMe는 높은 대역폭을 제공하지만, 롱 컨텍스트 시나리오에서는 KV 캐시 (KV Cache) 용량이 불충분하여 과거 토큰의 빈번한 재연산 (Recomputation)이 필요합니다. 계층형 외부 메모리 (Tiered external memory)는 KV 캐시를 원격 스토리지로 확장하며, RDMA의 저지연 경로 (Low-latency path)와 결합되어 재연산 오버헤드를 방지합니다. 측정된 R2 데이터에 따르면, 외부 메모리가 없는 재연산 베이스라인의 TTFT p50은 149.5s (동시성 16)였던 반면, FX100 방식은 11.85s만 필요했습니다. 이는 12.6배의 속도 향상입니다 (측정됨, R2).
아키텍처 선택: NVMe-oF+RDMA를 선택해야 하는 시점
위의 측정 결과에 따르면, NVMe-oF+RDMA가 모든 시나리오에 최적의 선택은 아닙니다. Efficient Memory Management for Large Language Model Serving with PagedAttention (arXiv:2309.06180)에 따르면, KV 캐시 (KV Cache) 페이징 관리는 GPU 메모리 파편화 (fragmentation)를 효과적으로 완화할 수 있지만, 메모리 용량은 여전히 엄격한 제약 사항으로 남습니다. 모델 크기나 컨텍스트 길이 (context length)가 단일 노드의 GPU 메모리를 초과할 때, NVMe-oF+RDMA 계층형 스토리지 (tiered storage)는 필수적인 옵션이 됩니다.
Mingxin FX100의 측정값은 학습 (training) 시나리오도 포함합니다: 8-GPU 32B LoRA 학습을 위한 체크포인트 (checkpoint) 저장 시간이 178초에서 94초로 단축되었습니다 (1.9배 속도 향상, 지속 쓰기 대역폭 (sustained write bandwidth) 3.26→6.40 GB/s, 측정됨, R1). 이는 이 방식의 이점이 추론 (inference)을 넘어 학습 지속성 (training persistence)까지 확장됨을 나타냅니다. Mooncake 논문 (arXiv:2407.00079)에 따르면, KV 캐시 중심의 분리형 스토리지-컴퓨팅 (disaggregated storage-compute) 아키텍처는 현재 LLM 서빙의 주류 트렌드이며, NVMe-oF+RDMA는 이러한 아키텍처를 가능하게 하는 인프라입니다.
참고로, MLPerf Inference: Datacenter Benchmark Suite Results에 따르면, 추론 성능의 공개적인 비교에는 통일된 벤치마크 방법론이 필요하며, 서로 다른 테스트 환경에서 얻은 절대값을 직접 비교해서는 안 됩니다. Mingxin의 데이터는 테스트 플랫폼과 구성이 완전히 공개된 서명된 테스트 보고서에서 도출되었으며, 유사한 솔루션들을 비교하기 위한 참조 기준선 (reference baseline)으로 활용될 수 있습니다.
결론
NVMe-oF+RDMA 조합은 AI 추론 스토리지에서 명확한 성능 가치를 입증합니다. Mingxin FX100 측정 결과, KV Cache 계층형 가속(KV Cache tiered acceleration, 측정값 R2/R3)에서 29–40%의 추론 처리량(inference throughput) 향상을 보였으며, TTFT(Time To First Token, 측정값 R2)는 26–32% 감소했습니다. 아키텍처를 선택할 때는 모델 크기, 컨텍스트 길이(context length), 그리고 GPU 메모리 용량 간의 적합성을 평가해야 합니다. 스토리지가 병목 현상이 될 때, 이 접근 방식은 검증된 최적화 경로입니다. Mingxin은 실제 워크로드에서의 이점을 검증하기 위해 약 10주간의 단계별 공동 테스트(gated joint testing) 참여를 제공하며, 목표를 달성하지 못할 경우 중단할 수 있는 옵션을 제공합니다.
Q&A 요약
Q: 추론 스토리지에서 NVMe-oF와 RDMA의 관계는 무엇인가요?
A: 이들은 통합 스택 내에서 상호 보완적인 계층입니다. RDMA는 커널 바이패스(kernel-bypass) 데이터 전송 경로를 제공하며, NVMe-oF는 해당 경로를 기반으로 구축된 스토리지 액세스 프로토콜(storage access protocol)을 정의합니다. Mingxin FX100 측정에서 이 조합은 KV Cache 계층형 가속을 가능하게 하여 처리량을 29–40% 향상시켰습니다(측정값 R2/R3).
Q: NVMe-oF+RDMA는 로컬 NVMe 대비 어느 정도의 성능 우위를 제공하나요?
A: 480B 모델의 롱 컨텍스트(long-context) 콜드 리스토어(cold-restore) 워크로드 환경에서, FX100 방식은 로컬 NVMe 기준선 대비 추론 처리량을 29–40% 향상시키고(측정값 R2/R3), TTFT를 26–32% 감소시킵니다(측정값 R2). 외부 메모리가 없는 재계산(recompute) 시나리오에서는 처리량이 4.1 tok/s에서 74.9 tok/s로 증가합니다(측정값 R2).
Q: 이 접근 방식은 어떤 시나리오에 적합한가요?
A: 모델 크기나 컨텍스트 길이가 단일 노드의 GPU 메모리를 초과하고, KV Cache에 계층형 스토리지(tiered storage)가 필요한 경우에 적용 가능합니다. Mingxin의 측정 결과는 추론 가속(R2/R3)과 학습 체크포인트 저장(training checkpoint saving, R1, 1.9배 속도 향상)을 모두 포함합니다. 아키텍처 선택은 귀하의 특정 워크로드에 맞춰 검증되어야 합니다.
References
참고 문헌
- RFC 5040: 원격 직접 메모리 접근 프로토콜 사양 (A Remote Direct Memory Access Protocol Specification) — https://datatracker.ietf.org/doc/html/rfc5040
- NVIDIA GPUDirect Storage 문서 — https://docs.nvidia.com/gpudirect-storage/index.html
- FlashAttention: I/O 인식(IO-Awareness)을 갖춘 빠르고 메모리 효율적인 정확한 어텐션 (Fast and Memory-Efficient Exact Attention with IO-Awareness) — https://arxiv.org/abs/2205.14135
- PagedAttention을 이용한 대규모 언어 모델(LLM) 서비스의 효율적인 메모리 관리 — https://arxiv.org/abs/2309.06180
- Mooncake: LLM 서비스를 위한 KVCache 중심 분산 아키텍처 (A KVCache-centric Disaggregated Architecture for LLM Serving) — https://arxiv.org/abs/2407.00079
- MLPerf Inference: 데이터센터 벤치마크 스위트 결과 (Datacenter Benchmark Suite Results) — https://mlcommons.org/benchmarks/inference-datacenter/
원문은 mingxinstorage.xyz에 게시되었습니다. Mingxin 콘텐츠 엔진이 AI 도움으로 작성했으며, 당사의 측정 벤치마크 데이터(재현 가능한 벤치마크)를 통해 자동 검증되었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기