Upscale AI가 Nvidia와 파트너십을 맺는 동시에 경쟁하는 이유
요약
본 기사는 CPU/GPU 메모리 연결 표준화의 어려움을 설명하며, Nvidia가 NVLink와 NVSwitch를 통해 독점적인 랙스케일 아키텍처 시장을 구축하고 있음을 분석합니다. Upscale AI는 이러한 시장 구조 속에서 경쟁과 파트너십을 동시에 추구하는 흥미로운 위치에 있습니다.
핵심 포인트
- Nvidia는 NVLink/NVSwitch를 통해 독점적인 랙스케일 메모리 시스템을 구축 중입니다.
- 현재 Nvidia는 고객이 자체 CPU나 XPU에 NVLink 포트를 추가하여 공유 메모리를 만드는 것을 제한합니다.
- Upscale AI는 시장의 표준화 흐름 속에서 경쟁과 협력을 동시에 모색하는 기업입니다.

Upscale AI가 Nvidia와 파트너십을 맺는 동시에 경쟁하는 이유
모든 CPU 제조사는 항상 여러 개의 CPU를 공유 메모리 클러스터로 연결하는 자신만의 매우 독점적인 방식을 가지고 있었습니다. 그리고 대부분의 경우, 이는 CCIX 컨소시엄이나 심지어 CXL 컨소시엄이 많은 CPU가 마치 하나의 훨씬 큰 CPU처럼 보이게 만드는 일종의 범용 접착제(universal glue)를 만들려는 노력에도 불구하고 여전히 사실입니다.
CPU SMP 및 NUMA 표준을 만들려는 시도는 대체로 실패했습니다. 왜냐하면 고객들이 CPU를 연결하는 표준 방식을 갖고 싶어 했음에도 불구하고, 다양한 벤더의 서로 다른 아키텍처를 가진 CPU들을 혼합하여 사용할 워크로드를 갖는 확률은 적었기 때문입니다. 게다가 각 벤더는 결국 CPU 자체에 내장되는 자신들의 SMP 및 NUMA 칩셋을 코어 설계, 메모리 서브시스템, I/O의 발전과는 별개의 속도로 혁신할 수 있었습니다. 그리고 가장 중요하게도, 그들은 필요한 기능을 승인해 줄 표준화 기구에 의존하지 않았고, 원하는 대로 차별화할 수 있었습니다.
그렇다면 왜 우리는 GPU와 XPU를 위한 NUMA 인터커넥트(현재 흔히 스케일 업 네트워킹이라고 불리는 것)의 표준 버전이 있을 것이라고 생각하는 걸까요? 희망은 영원하기 마련이고, 시장은 비용을 낮추는 경쟁을 사랑하기 때문입니다. (대체는 단지 좋은 아이디어가 아니라 경제학의 법칙입니다...)
명확한 것은 Nvidia가 NVSwitch와 NVLink 포트에 막대한 프리미엄을 부과할 수 있고 실제로 그렇게 한다는 점입니다. 이 포트들은 비교 불가능한 대역폭과 적절한 지연 시간을 제공하여, 회사가 NVL72 랙스케일 머신이라고 부르는 공유 메모리 시스템에 최대 72개의 GPU를 연결하는 데 사용됩니다. Nvidia는 NVLink Fusion 노력을 통해 커스텀 CPU 제작사들이 자신들의 장치에 NVLink 포트를 추가할 수 있도록 허용하여, 이들이 Nvidia GPU와 동일한 메모리 공간에 연결될 수 있게 하고 있으며, 마찬가지로 하이퍼스케일러(hyperscalers), 클라우드 빌더(cloud builders), AI 모델 빌더가 만든 XPU 가속기들도 NVLink 포트를 갖도록 허용하여 Nvidia의 랙스케일 아키텍처 내에 배치될 수 있게 합니다. 현재까지 우리가 아는 바로는, Nvidia는 고객들이 자신들의 CPU와 XPU 모두에 NVLink 포트를 추가하고 단순히 NVSwitch와 NVLink 프로토콜 라이선스를 구매하여 공유 메모리 시스템을 구축하는 것을 허용하지 않고 있습니다.
하지만 제가 지난 8월 In The Long Run, Nvidia NVSwitch Is The InfiniBand Of Scale Up AI Networks에서 이야기했듯이, 그런 날이 올 수도 있습니다. 그리고 가장 긴 관점에서 볼 때, 적절한 기술이 시장에 나온다면, Nvidia는 자체 프로토콜 오버레이를 가진 산업 표준 랙스케일 네트워크를 채택할 수 있을 것입니다. 특히 AI 추론(AI inference)의 경우 더욱 그렇습니다. (Nvidia가 이미 대부분의 시장을 장악하고 있는 AI 학습(AI training) 분야에서는 그런 양보를 할 이유가 없습니다.)
이것이 바로 제가 지난 1월에 시리즈 A 자금 조달로 2억 달러를 유치하던 때 이야기했던 Upscale AI가 매우 흥미로운 이유입니다. (여기서 회사 역사와 관련된 주요 플레이어들에 대해서는 자세히 다루지 않을 것이니, 배경 지식이 필요하면 그 이야기를 읽어보세요.) Upscale AI는 지금까지 총 5억 달러를 유치했으며, 기업 가치는 20억 달러로 두 배가 되었고, 직원 수 또한 지난 1월 발표 이후 300명 이상으로 두 배 이상 증가했습니다. 이번 주에 Upscale AI의 최고 경영진은 AI 클러스터를 위해 특별히 고안된 랙스케일 및 스케일 아웃(scale out) 네트워킹 계획에 대해 조금 더 공개했습니다.
너무 흥분하기 전에, 수년간 개발되어 온 “SkyHammer” 스케일 업 스위치 ASIC에 대한 속도와 세부 정보가 많이 공개되지는 않았습니다. Upscale AI의 공동 창립자이자 전무 이사인 Rajiv Khemani와 최고 경영자인 Barun Kar는 고성능 시스템 및 네트워킹 분야에서 오랫동안 깊은 경험을 쌓아왔기 때문에, 우리는 흥미로운 반전이 있을 것으로 예상합니다.
UPSCALE AI SKYHAMMER SKYFABRIX

웹 세미나 슬라이드를 읽어본 바로는—발표의 해당 부분을 맡은 회사의 제품 및 마케팅 수석 부사장인 Arvind Srikumar가 발표한 내용에 따르면—SkyHammer는 115.2 Tb/sec의 총 대역폭을 가질 것이며, 이는 현존 최고 수준이며 Cisco Systems, Broadcom, Nvidia의 스케일 아웃 네트워크 ASIC과 어깨를 나란히 할 수 있습니다. 차트에는 또한 SkyHammer 칩과 그것이 지원하는 SkyFabriX 아키텍처가 궁극적으로 여러 페타비트/초에 달하는 총 대역폭을 가진 스위치 장비를 갖게 될 것이라고 나와 있습니다.
이는 Broadcom과 Cisco가 고정 포트 및 모듈식 스위치 모두에서 자주 하는 것처럼, 여러 개의 SkyHammer ASIC을 하나의 스위치 내부에 묶어(ganging up) 달성될 가능성이 매우 높습니다. 지난 10년간 The Next Platform에서 Broadcom과 Meta Platforms의 발표를 지켜본 것을 아시다시피, 주어진 스위치 ASIC 아키텍처를 가진 포트의 대역폭을 여섯 개의 독립적인 ASIC으로 베이비 투-티어 네트워크(baby two-tier network)를 생성하여 두 배로 만들 수 있습니다. 네 개의 ASIC 중 절반의 대역폭은 다운링크(downlinks)를 만드는 데 사용되고, 나머지 절반은 동일한 칩 쌍을 사용하여 네 개의 ASIC을 서로 교차 연결(cross-couple)하는 데 사용됩니다. 이는 명백히 스위치를 통과하는 많은 포트 호프에 대한 지연 시간(latency)을 두 배로 만들지만, 모든 포트에 대해서는 그렇지 않습니다. 또한 특수 패브릭 커넥터(Broadcom의 “Jericho” 딥 버퍼 ASIC과 쌍을 이루는 “Ramon” 장치와 같은)를 사용하여 훨씬 더 큰 모듈식 스위치를 만들 수도 있습니다.
Upscale AI는 의심할 여지 없이 더 높은 집계 대역폭(aggregate bandwidth)을 가진 장치도 만들 것입니다. 이는 경제성이 작동하기 때문입니다. 6개의 스위치 ASIC으로 포트당 기본 대역폭의 2배를 갖는 스위치를 구축할 수 있지만, 대역폭이 2배인 단일 장치를 만드는 것과 비교했을 때 포트당 비용은 약 1.5배가 듭니다. (이는 제작 비용이 아닌 시장 가격입니다.) 이 회사는 향후 SkyHammer ASIC에 대한 로드맵을 제공하지 않았습니다.
메모리 도메인 확장성(memory domain scalability) 측면에서 볼 때, SkyHammer 칩의 아키텍처는 단일 네트워킹 계층(networking tier)에서 최대 576개의 가속기(accelerator)를 지원할 수 있으며, NVSwitch와 마찬가지로 여러 네트워크 계층을 사용하면 이를 더욱 확장할 수 있습니다. 이 경우 '수천 개의 가속기'에 달합니다. 정확히 몇 개가 될지는 지켜봐야 하지만, 1,024개 또는 1,156개가 목표가 되는 두 숫자로 보입니다. UALink 컨소시엄은 단일 계층에서 1,024개의 XPU를 약속하고 있으며, Nvidia는 NVSwitch를 현재의 576 GPU 한계를 넘어 'Rubin Ultra' GPU 세대에서는 1,152 GPU까지 확장하려고 할 것입니다. (이는 단일 계층이 아닌 다중 계층 네트워크를 사용한 경우입니다.) Nvidia는 현재 단일 도메인에서 72개의 GPU를 지원하며, 여러 계층을 통해 576개 GPU가 가능하지만 이는 프로덕션 워크로드를 위한 것이 아닙니다.
SkyHammer의 576개 장치 숫자에 대해 계산해 보면, 각 장치는 200 Gb/sec의 대역폭을 얻게 됩니다. 이는 'Grace-Blackwell' NVL72 시스템에서 NVSwitch 5/NVLink 5 세대가 제공하는 1.8 TB/sec보다 명백히 적습니다. 'Vera-Rubin' NVL72 시스템은 NVSwitch 6/NVLink 6을 탑재하여 3.6 TB/sec를 가질 것입니다. 72개의 XPU로 SkyHammer는 포트당 1.6 Tb/sec를 제공하지만, 이는 여전히 스케일 업 네트워크에서 200 GB/sec의 메모리 대역폭에 불과합니다. 이는 NVSwitch 5 스택의 6분의 1 수준입니다. (NVSwitch 명칭은 정규화했습니다.)
특히 AI 추론(AI inference) 워크로드를 위해서는 대역폭이 지연 시간(latency)보다 더 중요하다는 것은 전혀 분명하지 않습니다. 그리고 구글이 우리에게 가르쳐준 것처럼, 예측 가능한 지연 시간이 낮은 지연 시간보다 항상 더 중요합니다.
토큰과 관련하여 가장 중요한 지표 중 하나는 레이턴시(latency)입니다.” Srikumar가 The Next Platform에 말했습니다. “우리는 생산해야 하지만, 이것은 Rajiv와 Barun이 과거에 했던 것과는 조금 다릅니다. AI의 경우 레이턴시는 매우 예측 가능해야 하며, 우리는 ASIC에 예측 가능한 지터(jitter)를 내장했습니다. 동시에 도메인 내 전송 신뢰성 또한 중요합니다. 링크 레벨 신뢰성을 제공하는 표준 기반 프로토콜을 가지고 있지만, 패브릭 내부에서는 패브릭이 100% 무손실임을 보장하는 메커니즘을 갖추고 있습니다. 이것이 바로 우리가 이를 안정적이고 예측 가능한 레이턴시라고 부르는 이유이며, 우리는 레이턴시를 최소화하고 있습니다. 구체적인 수치를 발표하면 놀라실 수도 있습니다. 많은 이더넷 패브릭(Ethernet fabrics)을 보면 거의 고정된 파이프라인 배열(pipeline arrangement)이 있고, 병렬성(parallelism)이 낮은 파이프라인 배열입니다. 우리는 여기서 지금까지의 이더넷 패브릭에서 이루어진 것들을 뛰어넘는 많은 일들을 하고 있습니다. 저희는 SkyFabriX가 단순히 기존의 이더넷 패브릭을 가져와 스케일업에 필요한 프로토콜을 개조하는 것이 아니라, 백지 상태(clean sheet of paper)에서 시작했기 때문에 시장에서 독보적인 위치를 차지할 것이라고 믿습니다.”
누구든지 무엇이라고 믿든, 사람들이 UALink를 이더넷 위로(UALoE, 오늘날 일반적인 용어) 그리고 ESUN 메모리 프로토콜을 스케일업에 맞게 조정된 고속 이더넷 스위치 위에 올리기 시작하면서 어떤 것이 작동하고 어떤 것이 그렇지 않은지 알아내게 될 것입니다.
SkyHammer가 UALink 자체가 아니라 UALoE를 실행하고 있고, 이것이 ESUN을 보여준다는 사실은 SkyHammer가 내부적으로는 이더넷 스위치 ASIC라는 것을 알려줍니다. 저는 더 많은 레딕스(radix)를 가진 더 빠른 스위치 ASIC이어서 UALink 네이티브로 실행하고 필요할 때 ESUN의 에뮬레이션 버전을 실행할 수 있기를 바랐습니다. 하지만, 어쩔 수 없죠.
여기 흥미로운 부분이 있습니다. Upscale AI는 Nvidia와 파트너십을 맺어 스케일 아웃(scale out) 패브릭의 선택 공급업체가 되었으며, 특히 Spectrum-X 이더넷 스위치를 선택했습니다. 당연히 Quantum-X InfiniBand 스위치는 아닙니다. 왜냐하면 이 회사의 창립자들은 궁극적으로 이더넷이 InfiniBand을 제압할 것이라고 강력하게 믿기 때문입니다. 일부 사람들은 Ultra Ethernet Consortium의 사양과 호환되는 첫 세대 이더넷 스위치만으로도, 거의 30년 동안 InfiniBand이 고성능 표준을 설정해 온 역사를 거쳐 이 목표가 달성될 것이라고 말합니다. 포트 간(port-to-port) 홉 지연 시간(hop latency) 면에서는 여전히 InfiniBand이 이더넷보다 훨씬 우수할 것입니다. 하지만 이더넷은 더 가까워질 수 있으며, 주어진 네트워크 토폴로지에서 InfiniBand보다 훨씬 더 많이 스케일 아웃 할 수 있습니다. 그리고 Nvidia는 HPC 및 AI 워크로드에 가장 낮은 지연 시간을 필요로 하는 사람들에게 InfiniBand을 엄청나게 판매할 것입니다. 걱정하지 마세요.

구체적으로, Upscale AI는 Nvidia의 Spectrum-X ASIC을 인수하여 이를 기반으로 자체 스케일 아웃 스위치를 구축하고, SkyFabriX 스위치에서 실행되는 네트워크 운영 체제인 SkyOS를 포팅(porting)하여 Spectrum-X ASIC에서도 작동하도록 할 것입니다. 이것이 가능한 이유는 SkyOS가 2016년경 Microsoft가 개발한 SONiC 네트워크 운영 체제와 그 관련 Switch Abstraction Interface (SAI)의 AI 최적화 버전이며, 이 SAI는 많은 하이퍼스케일러 및 클라우드 빌더 데이터센터에서 사실상의 표준(de facto standard)이 되었기 때문입니다. Upscale AI 버전의 Spectrum-X는 400 Gb/sec, 800 Gb/sec, 그리고 1.6 Tb/sec 포트를 지원할 것입니다.
Upscale AI에 따르면 중요한 점은 SkyOS가 scale up과 scale out 네트워크 모두를 아우를 것이며, 그 SkyCMD 원격 측정 및 오케스트레이션 도구는 이 두 네트워크 전체를 하나의 시스템으로 볼 수 있다는 것입니다. 또 다른 중요한 점은 고객들이 어떤 CPU든, 어떤 GPU든, 또는 DPU나 NIC로 프런트엔드된 어떤 XPU든 사용할 수 있고, 이러한 장치들을 혼합하여 AI 클러스터를 만들 수 있다는 것입니다. 이 모든 것이 아주 좋지만, Nvidia는 scale up을 위한 NVSwitch의 대안으로 SkyHammer와 그 SkyOS를 지원하지 않고 있습니다. 현재로서는 Nvidia GPU로 scale up하는 방법이 없습니다. AMD는 실제로 Upscale AI 같은 회사들이 UALink, UALoE 또는 ESUN을 지원하는 scale up 네트워킹 옵션을 제공하기를 기대하고 있으며, 인내심을 잃고 그냥 Upscale AI를 인수하여 그 옵션 중 하나를 소유하고 돈을 벌 수도 있습니다. (왜 안 될까? AMD는 주식으로 재미있는 돈이 많으니, 그걸 좀 쓸 만도 합니다.)
마지막으로 한 가지: Nvidia는 NVSwitch ASIC의 포트당 대역폭을 줄이고 스위치의 레딕스(radix)를 늘려 NVSwitch 네트워크를 평탄화할 수는 있습니다. 하지만 그렇게 하려면 대역폭을 희생해야 합니다. NVLink 프로토콜을 SkyHammer로 포팅하는 것이 더 빠를 수 있으며, Nvidia가 UALoE 또는 ESUN 스위칭 분야의 지배적인 공급업체가 될 수도 있습니다. 두고 봐야 할 일입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 The Next Platform의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기