NUNA: 멀티 다이(Multi-Die) GPU 스케일업(Scale-Up) 시스템에서의 비균일 네트워크 액세스(Non-Uniform
요약
멀티 다이 GPU 시스템에서 발생하는 비균일 네트워크 액세스(NUNA) 문제를 해결하기 위한 새로운 연구를 소개합니다. NUNA 인식 라우팅(NAR)과 배치(NAP) 기술을 통해 GPU 간 통신 지연을 최적화하고 머신러닝 추론 성능을 향상시킵니다.
핵심 포인트
- 멀티 다이 GPU의 와이어 전송 지연 문제를 해결하기 위한 NUNA 개념 도입
- NUNA 인식 라우팅(NAR)을 통한 최적의 GPU 간 경로 선택
- NUNA 인식 배치(NAP)로 집합 통신 속도 최대 1.5배 향상
- NAR과 NAP 결합 시 집합 통신 최대 1.8배 및 추론 속도 개선
그래픽 처리 장치(GPU) 아키텍처는 증가하는 연산 및 메모리 요구 사항을 충족하기 위해 규모가 커지고 있습니다. GPU 크기가 커짐에 따라 소켓 내부(intra-socket) 와이어 전송 지연(wire transfer delay)이 크게 증가합니다. 이전 연구들은 소켓 내의 연산 및 메모리 지역성(locality)을 최적화해 왔으나, GPU 간 통신(inter-GPU communication)에 미치는 공간적 영향에 대해서는 충분히 연구되지 않았습니다. 우리는 멀티 GPU 시스템에서 새롭게 등장하는 이러한 최적화 차원을 설명하기 위해 비균일 네트워크 액세스(Non-Uniform Network Access, NUNA)라는 용어를 도입합니다. 우리는 특히 머신러닝 추론(machine learning inference)에서 흔히 발생하는 지연 시간 민감형 집합 통신(latency-sensitive collective communication)에 초점을 맞춥니다. 첫째, 대규모 스케일업(scale-up) 네트워크 토폴로지에서 최적화되고 공간을 인식하는 GPU 간 경로를 선택하는 NUNA 인식 라우팅(NUNA-aware routing, NAR)의 필요성을 강조합니다. 둘째, GPU 간 트래픽을 최적화하기 위해 스레드 블록(threadblocks)과 데이터를 I/O 근처에 배치하는 NUNA 인식 배치(NUNA-aware placement, NAP)를 도입합니다. 우리는 NAP 최적화만으로도 지역성을 고려하지 않은 베이스라인(locality-unaware baseline) 대비 최대 1.5배의 집합 통신 속도 향상을 제공함을 입증합니다. NAP와 NAR을 결합하면 지역성을 고려하지 않은 베이스라인 대비 최대 1.8배 빠른 집합 통신을 달 수 있습니다. 이는 머신러닝 추론에서 출력 토큰당 평균 시간(mean time per output token)을 7%(최대 28%) 단축하는 결과로 이어집니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기