TRANSIT: 다중 노드 LLM 학습을 위한 투명한 스케일 인(Scale-in)
요약
TRANSIT은 CPU DRAM을 GPU 메모리 확장으로 투명하게 활용하여 다중 노드 LLM 학습이 가능한 스케일 인 프레임워크입니다. 사용자 공간 가로채기 계층과 제로 카피 데이터 경로를 사용해 시스템 수정 없이 높은 효율성을 제공합니다. 평가 결과, 기존 오프로딩 기술 대비 처리량 및 GPU 절감 효과가 크게 입증되었습니다.
핵심 포인트
- CPU DRAM을 활용하여 LLM 학습의 메모리 병목 현상을 해결합니다.
- 시스템 수정이 필요 없는 사용자 공간 가로채기 계층으로 구현되어 범용성이 높습니다.
- 최신 오프로딩 기술 대비 높은 GPU당 처리량 및 효율성을 달성했습니다.
- GPU를 50% 적게 사용하면서도 기존 성능의 90% 이상을 유지할 수 있습니다.
TRANSIT은 분산 학습 중 CPU DRAM을 GPU 메모리의 확장으로 투명하게 활용하여 더 적은 GPU로도 다중 노드 모델 학습이 가능하도록 하는 투명한 스케일 인 프레임워크입니다. 이는 사용자 공간 가로채기 계층(user-space interposition layer)을 통해 구현되며, 애플리케이션, 학습 프레임워크, 클러스터 스케줄러, 디바이스 드라이버 또는 운영체제에 어떠한 수정도 필요하지 않습니다. 또한, TRANSIT은 CPU-GPU 전송을 위한 제로 카피 데이터 경로(zero-copy data path)를 활용하여 더 높은 효율성을 달성합니다. 우리는 RoCE 네트워크 상에서 최대 64개의 NVIDIA H100 GPU 및 여러 병렬 처리 구성을 아우르는 범위의 밀집형(dense) 모델과 MoE 모델에 대해 TRANSIT을 평가했습니다. 우리의 평가는 TRANSIT이 다음을 수행할 수 있음을 보여줍니다: (a) TorchTitan, ZeRO-Offload, 그리고 ZeRO-Infinity보다 각각 최대 68%, 59%, 42% 높은 GPU당 처리량(per-GPU throughput)을 달성하며 최신 프레임워크 관리 오프로딩 기술(state-of-the-art framework-managed offloading techniques)을 능가합니다. (b) 기준선 대비 90% 이상의 GPU당 처리량을 유지하면서 GPU를 50% 적게 사용하여 학습할 수 있게 합니다. (c) 노드당 네트워크 트래픽을 최대 33%까지 낮추고, (d) 통신 제한 환경(communication-bound settings)에서 GPU당 처리량을 최대 35% 향상시킵니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기