Microsoft, AMD와 협력하여 대규모 AI CPU 및 GPU 클러스터 구축
요약
Microsoft가 AMD와 협력하여 대규모 AI 클러스터 구축 계획을 발표했습니다. 이 시스템은 AMD의 Helios 랙 설계를 기반으로 하며, MI455X GPU와 Epyc 9006 CPU를 활용합니다. 총 18,000개의 GPU 컴퓨팅 유닛과 2.9 exaflops 성능을 목표로 하는 초대형 인프라입니다.
핵심 포인트
- Microsoft-AMD 협력으로 대규모 AI 클러스터 구축 예정
- 총 18,000개 GPU와 4,600개 Zen 6 CPU 코어 보유 예상
- 2.9 exaflops 성능을 목표로 하며 Azure 클라우드에 적용될 전망
- Pensando DPU를 활용하여 높은 집계 대역폭(43 TB/sec) 제공
CLOUD
Microsoft가 AMD를 활용해 대규모 AI CPU 및 GPU 클러스터를 구축하다
우리는 이상한 시대에 살고 있습니다. AMD와 Nvidia가 2026년 말까지 생산할 수 있는 모든 GPU와 CPU는 아직 모두 제조되지 않았음에도 불구하고 이미 오래전에 팔려나갔습니다. 그리고 그렇다면, 이들 중 어느 회사든 제품 출시를 중단하고 싶다면 그렇게 할 수도 있을 것입니다.
우리가 듣게 될 것은 오직 침묵뿐일 겁니다...
하지만 아아, AMD가 이번 목요일 실리콘밸리에서 열리는 Advancing AI 2026 행사에서 발표할 주요 제품 공개를 통해 나오는 모든 무료 언론과 분석은 어떤 IT 공급업체에게나 큰 축복입니다. GPU 가속 시스템이나 올-CPU 클러스터와 관련하여, AMD는 GenAI 하드웨어 거대 기업인 Nvidia가 돈을 벌어들이고 있는 두 가지 핵심 영역에서 직접적인 압력을 가하는 거의 유일한 회사입니다.
Advancing AI 행사를 앞두고 Microsoft와 AMD는 AMD의 "Helios" 랙 설계를 기반으로 하며, AMD의 "Altair" MI455X GPU, "Venice" Epyc 9006 CPU, Pensando DPU 및 ROCm 소프트웨어 스택을 포함한 다양한 하드웨어 및 소프트웨어 기술들을 활용하여 대규모 AI 시스템을 구축하기 위해 협력한다는 사실을 발표했습니다.

이 이중 폭의 Helios 랙은 18개의 컴퓨팅 트레이에 걸쳐 4,600개의 Zen 6 CPU 코어를 보유하고 있으며, 각 트레이에는 CPU와 GPU 네 개가 포함됩니다. 이는 Venice 프로세서당 256개 코어에 해당하며, 또한 랙당 72개의 GPU를 통해 총 18,000개의 GPU 컴퓨팅 유닛을 확보할 수 있습니다. 이 GPU들은 FP4 정밀도에서 2.9 exaflops의 성능을 제공합니다. GPU는 총 31 TB의 HBM 4 스택 메모리를 보유하고 있으며, P4 언어로 프로그래밍 가능한 Pensando DPU를 통해 집계 대역폭으로 43 TB/sec을 제공합니다. 이는 핵심 기능이며, Microsoft가 현재까지 Pensando DPU의 가장 지배적인 배포자였기 때문에 특히 주목받는 부분입니다.
Microsoft나 AMD 어느 쪽도 Big Bill이 Helios 랙에 얼마나 많은 돈을 투입하고 있는지에 대해서는 언급하지 않고 있지만, 저희는 수십만 개의 GPU와 50억 달러에서 100억 달러 사이의 금액이 될 것으로 예상합니다. 확실한 것은 이것이 매우 대규모 배포이며, Azure 클라우드에서 프론티어 모델(frontier models)의 추론(inference)을 실행하는 데 매우 구체적으로 초점을 맞추고 있다는 것입니다.
Helios 랙의 스케일 아웃 네트워킹(scale out networking)은 의심할 여지 없이 이더넷(Ethernet)이며, Arista Networks가 이 네트워크 부분의 스위치 공급업체일 가능성이 매우 높습니다.
반면, 랙 내부의 스케일 업 네트워크(scale up network)와 MI455X GPU의 HBM 메모리를 연결하는 이야기는 더 불분명합니다. Microsoft와 Meta Platforms 모두 Nvidia의 NVLink/NVSwitch 조합에 대한 대안으로 떠오르는 ESUN 코히런트 메모리 패브릭 프로토콜과, AMD 및 지인들이 2024년 5월에 출시한 UALink 프로토콜을 열렬히 지지하고 있습니다. (저희는 지난 4월에 UALink에 대해 자세한 글을 작성했으며, 올해 1월에는 Upscale AI와도 고래딕스(high radix), 고대역폭 UALink 스위치를 출시하려는 그들의 의지에 대해 이야기했습니다.) Microsoft는 초기 Helios 랙에서는 저지연 이더넷 스위치에서 ESUN을 실행하다가 나중에 UALink 스위치로 전환할 수 있습니다. 하지만 말씀드렸듯이, 이것은 불분명하며 Microsoft가 무엇을 하고 있는지 자랑하기 전까지는 그럴 것입니다.
아마도 Advancing AI 행사에서 더 많은 통찰력을 얻게 될 것 같습니다.
이 대규모 Helios 클러스터 배포 외에도, Microsoft는 Azure 클라우드의 두 가지 다른 인스턴스에서 기반이 될 Venice Epyc CPU 클러스터를 배포하는 데 전념했습니다. Azure HDv2 인스턴스는 에이전틱 AI(agentic AI) 워크로드와 데이터 파이프라인 처리를 목표로 할 것이며, HXv2 인스턴스(아마도 더 많은 코어를 탑재한)는 칩의 전자 설계 자동화(electronic design automation)를 목표로 할 것입니다.
또한 Microsoft는 Azure Boost 가속 소프트웨어를 Pensando DPU로 이전하기 위해 AMD와 협력하고 있습니다. Microsoft는 2024년 11월에 Azure Boost 초기 배포를 위해 자체 DPU를 만들었으며, 이제는 자체 네트워크 및 스토리지 가상화를 P4 루틴과 Pensando DPU로 포팅하는 것으로 보입니다.
이 모든 것을 말하고 나니, 우리는 여전히 Microsoft 내에서 Nvidia와 AMD 간의 GPU 확보 분배가 아마 70대 30 또는 75대 25 정도일 것이라고 믿습니다. 핵심은 누가 어떤 HBM 메모리 할당량을, 그리고 언제 받느냐에 달려 있습니다. 만약 Nvidia가 HBM의 80%를 가지고 있다면, XPUs의 80%도 팔게 될 것입니다. 정말 그렇게 간단합니다. 하지만 우리는 AMD의 AI 학습 및 추론 파이에서의 점유율이 증가하고 있다고 생각하며, 이는 HBM 할당량 또한 증가하고 있음을 의미해야 합니다. 그렇지 않다면 반독점 및 무역 제한에 관한 거대한 소송이 있을 것입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 The Next Platform의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기