
Nvidia, 추론 성능 향상을 위한 Rubin 아키텍처 최적화 상세 내용 공개 – GPU에서 랙(Rack) 규모까지 성능 및 효율성 개선 목표
요약
Nvidia가 차세대 Vera Rubin 플랫폼의 상세 사양을 공개했습니다. Rubin 아키텍처는 에이전트형 AI 추론 수요에 대응하기 위해 GPU 레벨부터 랙 규모까지 성능과 효율성을 극대화하도록 설계되었습니다.
핵심 포인트
- Rubin GPU는 288GB HBM4 메모리와 22 TB/s 대역폭 제공
- NVFP4 추론 시 50 sparse PFLOPS의 압도적인 처리량 달성
- 에이전트형 AI 워크로드 가속을 위한 추론 중심 설계
- GPU 단일 패키지에 두 개의 컴퓨트 다이를 결합하는 구조
올해 말 출시 예정인 Nvidia의 차세대 Vera Rubin 플랫폼은 AI 세계가 프런티어(Frontier) 학습 중심에서 대규모 에이전트형 AI 추론(Agentic AI inference) 수요가 지배하는 시대로 전환됨에 따라 그 무대에 오를 것입니다. 에이전트형 워크플로우(Agentic workflows)에서의 생성 토큰에 대한 갈증과 이를 빠르고 효율적이며 낮은 단위 비용으로 전달해야 하는 요구사항이 현재 논의의 중심을 차지하고 있습니다.
우리는 이미 Vera CPU에 관한 새로운 성능 데이터와 이것이 어떻게 에이전트형 AI 워크로드(Agentic AI workloads)를 가속화하는지에 대해 심도 있게 다룬 바 있지만, Nvidia가 오늘 공유하는 내용은 그게 전부가 아닙니다. Nvidia는 또한 Rubin 아키텍처의 몇 가지 새로운 기능과 이러한 기능들이 이 가속기 플랫폼의 GPU 레벨부터 랙(Rack) 규모 및 데이터 센터 규모 구현에 이르기까지 추론 효율성을 어떻게 높이도록 설계되었는지에 대해 상세히 설명하고 있습니다.

(이미지 출처: Nvidia)
전체 Vera Rubin NVL72 랙 규모 시스템은 36개의 Vera CPU와 72개의 Rubin GPU로 구성되지만, 오늘 우리의 초점은 GPU 자체에 맞춰져 있습니다. Rubin은 Nvidia High Bandwidth Interface를 사용하여 두 개의 컴퓨트 다이(Compute dies)를 단일 패키지에 결합합니다. 결과물인 칩은 총 896개의 Tensor Core를 포함하는 224개의 스트리밍 멀티프로세서(Streaming Multiprocessors, SMs)와 22 TB/s의 메모리 대역폭을 제공하는 288GB의 HBM4 메모리를 제공합니다.
추론 중심의 가속기로서, Nvidia는 Rubin의 핵심 성능 수치로 50 sparse PFLOPS의 NVFP4 추론 처리량(Inference throughput)을 내세우고 있지만, 이는 이 칩이 처리할 수 있는 어지러울 정도로 다양한 데이터 유형 중 하나일 뿐입니다. 지금까지 이 칩에 대해 기억해야 할 몇 가지 주요 수치는 다음과 같습니다:
<table><tbody><tr><td class="firstcol "><p><strong>Nvidia Rubin GPU</strong></p></td><td></td></tr><tr><td class="firstcol "><p>NVFP4 Inference</p></td><td><p>50 PFLOPS (with sparsity)</p></td></tr><tr><td class="firstcol "><p>NVFP4 Training</p></td><td><p>35 PFLOPS</p></td></tr><tr><td class="firstcol "><p>FP8/FP6 Training</p></td><td><p>17.5 PFLOPS</p></td></tr><tr><td class="firstcol "><p>INT8</p></td><td><p>250 TOPS</p></td></tr><tr><td class="firstcol "><p>FP16/BF16</p></td><td><p>4 PFLOPS</p></td></tr><tr><td class="firstcol "><p>TF32</p></td><td><p>2 PFLOPS</p></td></tr><tr><td class="firstcol "><p>FP32</p></td><td><p>130 TFLOPS</p></p></td></tr><tr><td class="firstcol "><p>FP64</p></td><td><p>33 TFLOPS</p></td></tr></tbody></table>Rubin이 추론 워크로드(inference workloads)를 위해 개선한 몇 가지 사항을 살펴보면서 Nvidia가 어떻게 이 모든 리소스를 완전히 활용할 수 있도록 하는지 알아보겠습니다.
Rubin 텐서 메모리 가속기(Tensor Memory Accelerator, TMA)는 성장하는 MoE 모델을 효율적으로 관리합니다
먼저, Nvidia는 텐서 코어(Tensor Cores)에 데이터를 공급하는 데 도움을 주는 텐서 메모리 가속기(TMA)의 효율성 개선 사항을 강조했습니다. TMA는 메모리 주소 계산을 처리하고 배열 데이터(array data)를 GPU의 공유 로컬 메모리(shared local memory)로 직접 로드하도록 구축된 전용 엔진입니다.
선도적인 AI 모델 아키텍처들은 모든 파라미터가 출력 토큰당 활성화되는 밀집형 모델(dense models)에서, 특정 전문화된 하위 네트워크(specialized sub-networks)만이 토큰당 활성화되는 전문가 혼합(mixture-of-experts, MoE) 아키텍처로 이동했습니다. 이 과정은 주어진 입력을 처리하는 데 어떤 전문가가 가장 적합한지 판단하는 라우터(router)의 안내에 따라 이루어집니다.
MoE 전문가 가중치(expert weights)는 제한된 GPU당 HBM 용량을 효율적으로 활용하기 위해 여러 GPU에 분산될 수 있습니다. Nvidia에 따르면, Rubin의 TMA는 오늘날 선도적인 모델에서 증가하는 전문가 수를 관리하는 어려움에 대처하도록 개선되었습니다.

(이미지 출처: Nvidia)
Blackwell GPU의 TMA(Tensor Memory Accelerator)는 모든 전문가(expert)의 위치를 위해 메모리에 별도의 MoE 디스크립터(descriptor)를 유지해야 했습니다. 이는 전문가의 수가 증가함에 따라 해당 전문가 가중치(expert weights)를 찾고 이동시키는 데 드는 오버헤드가 더 많은 연산 자원을 필요로 함을 의미합니다.
이제 Rubin의 TMA는 런타임 시 TMA 명령어 내에서 단일 통합 MoE 디스크립터를 직접 유지하고 업데이트하는 GPU 커널을 지원하여, MoE 디스크립터 메타데이터의 계산을 줄이고 데이터 이동을 위한 계산 오버헤드를 최소화합니다. 이러한 접근 방식은 GPU 사이클을 추론 연산에 할당할 수 있게 해주며, 이는 당연히 고가의 AI 가속기가 대부분의 시간을 소비해야 하는 핵심 영역입니다.
K-차원 처리량 두 배 증가, Tensor Core 출력 두 배 증가
Rubin은 또한 Tensor Core가 K-차원(K-dimension), 즉 곱해질 두 행렬의 공유 내부 차원(shared inner dimension)에서 수행할 수 있는 작업량을 두 배로 늘림으로써 행렬 연산의 근본적인 성능을 개선합니다. 수학적으로 너무 깊게 들어가지 않더라도, K-차원의 크기는 Tensor Core가 곱해지는 두 행렬의 요소들을 루프(loop)를 돌며 처리해야 하는 횟수와 직접적인 관련이 있습니다.

(이미지 출처: Nvidia)
Nvidia의 예시에 따르면, Blackwell에서는 4번의 루프 반복이 필요했던 결과 행렬 계산을 Rubin에서는 단 2번의 반복만으로 완료할 수 있습니다. Nvidia는 이러한 개선이 처리량(throughput), 메모리(memory), 지연 시간(latency)에 제한을 받는 커널(bound kernels) 모두에 광범위한 이점을 제공하며, 추론의 컨텍스트 처리(context processing) 및 디코드(decode) 단계 모두에 도움이 된다고 밝혔습니다.
Rubin의 Softmax, Blackwell 대비 최대 4배 성능 향상
Rubin은 또한 트랜스포머(transformer) 기반 LLM의 기초가 되는 어텐션 메커니즘(attention mechanism)의 성능 개선에도 집중하고 있습니다. 더욱 발전된 모델들은 이제 최대 100만 토큰의 컨텍스트 길이(context lengths)를 지원하며, 이러한 긴 입력 시퀀스에 대해 어텐션 계산을 빠르게 수행하는 것은 추론 성능 향상의 핵심 동력입니다.
Softmax는 어텐션 (Attention) 계산에서 필수적인 연산이며, Rubin의 향상된 Tensor Core 처리량 (Throughput)에 발맞추기 위해 Nvidia는 GPU SM의 특수 기능 유닛 (SFU, Special Function Unit) 내 Softmax 처리량을 다시 한번 끌어올렸습니다.
Softmax는 SFU의 초월 함수 (Transcendental math) 계산 능력에 의존하기 때문에, Softmax 처리량이 이후의 추론 작업에 병목 현상 (Bottleneck)이 될 수 있습니다. 이는 Nvidia가 Blackwell Ultra SFU의 개선을 통해 이미 해결하고자 했던 제한 사항입니다. Blackwell Ultra는 1세대 Blackwell GB200과 비교하여 FP32 및 BF16/FP16 지수 (Exponential) 처리량을 두 배로 높였습니다.
<table><tbody><tr><td class="firstcol "><p>GPU</p></td><td><p>FP32 Exponential Throughput</p></td><td><p>BF16/FP16 Exponential Throughput</p></td></tr><tr><td class="firstcol "><p>Blackwell</p></td><td><p>1x</p></td><td><p>1x</p></td></tr><tr><td class="firstcol "><p>Blackwell Ultra</p></td><td><p>2x</p></td><td><p>2x</p></td></tr><tr><td class="firstcol "><p>Rubin</p></td><td><p>2x</p></td><td><p>4x</p></td></tr></tbody></table>Rubin은 FP32 지수 연산에서 Blackwell 대비 Blackwell Ultra와 동일한 2배의 속도 향상을 유지하며, Blackwell Ultra와 비교하여 BF16/FP16 지수 계산을 다시 한번 두 배로 높여, 해당 저정밀도 (Lower-precision) 데이터 타입에 대해 Blackwell 대비 4배의 처리량 향상을 이끌어냈습니다.
더 세밀한 의존성 관리, 더 나은 Tensor Core 점유율 (Occupancy)
Rubin은 또한 Blackwell보다 종속적 커널 (Dependent kernels) 간의 조율을 위한 더 세밀한 (Finer-grained) 기회를 제공함으로써 Tensor Core 점유율 (Occupancy)을 높입니다. Nvidia가 이러한 의존성이 발생하는 사례로 언급한 것 중 하나는 LLM의 활성화 값 (Activations) 생성입니다. 이 과정에서는 하나의 커널이 데이터를 생성 및 저장하면, 프롬프트가 신경망 (Neural network)을 통과함에 따라 이후의 커널이 해당 데이터를 사용하게 됩니다.

(이미지 출처: Nvidia)
Blackwell GPU에서는 하나의 스레드 블록(Thread block)에서 실행되는 장시간 실행되는 프로듀서 커널(Producer kernel)(아마도 클러스터(Cluster)와 같은 CUDA 구조 내에서)이, 프로듀서 커널의 다른 스레드 블록들이 작업을 마쳤음에도 불구하고 해당 스레드 블록들에서 실행될 후속 컨슈머 커널(Consumer kernel)의 실행을 지연시킬 수 있습니다.
Rubin은 커널 간의 더 세밀한 의존성 해결(Dependency resolution)을 제공하여, 컨슈머 커널이 프로듀서 커널 데이터 전체 배치가 준비될 때까지 기다리는 대신, 각 스레드 블록으로부터 프로듀서 커널의 출력이 나오는 즉시 개별 스레드 블록에서 실행을 시작할 수 있도록 합니다. 이러한 세밀한 관리 방식은 더 나은 GPU 활용도(Utilization), 더 낮은 커널 간 지연 시간(Kernel-to-kernel latency)을 결과로 가져오며, 궁극적으로 사용자당 초당 토큰 수(Tokens per second per user)를 증가시킵니다.
더 효율적인 GPU 간 통신, 더 낮은 NVLink 오버헤드
지금까지 논의한 모든 개선 사항은 하나의 GPU에서 작업이 어떻게 수행되는지와 관련이 있지만, Vera Rubin NVL72 랙 규모(Rack-scale) 가속기는 랙 내부의 NVLink 패브릭(Fabric)을 통해 연결된 수많은 GPU로 구성됩니다. 모델 가중치(Model weights), 키-값 캐시(Key-value cache) 데이터, 그리고 GPU 간 동기화 메시지가 모두 이 패브릭을 통해 이동하므로, 오버헤드와 지연 시간을 낮게 유지하는 것이 최대 성능을 실현하는 핵심입니다.
CUDA 커널을 실행하는 GPU는 Nvidia Collective Communications Library (NCCL) API를 사용하여 랙 내의 다른 GPU와 직접 통신을 시작할 수 있어 오버헤드를 낮춥니다. Nvidia는 GPU가 연산 커널(Compute kernel)의 일부로서 이러한 작업을 직접 수행하기 때문에, 이러한 통신의 효율적인 실행이 성능에 결정적인 역할을 한다고 언급합니다.

(이미지 출처: Nvidia)
Blackwell 시스템에서 GPU 간의 NVLink 전송은 데이터 저장(Data store) 작업에 이어 메모리 장벽(Memory barrier)과 원자적 플래그(Atomic flag)가 필요할 수 있습니다. Rubin 아키텍처는 패브릭을 통해 GPU 간에 데이터를 공유하는 데 필요한 조정 및 동기화 트래픽의 양을 줄여주는 카운티드 라이트(Counted writes)라는 기능을 도입했습니다.
Rubin에서는 메모리 장벽 (Memory barrier) 및 원자적 연산 (Atomic operations)이 수신 측 GPU에서의 단일 쓰기 카운터 업데이트로 대체되어, 네트워크 트래픽과 지연 시간 (Latency)을 줄이고 조정 오버헤드 (Coordination overhead)를 기다리는 시간을 단축함으로써 연산 활용도 (Compute utilization)를 향상시킵니다.
결과적으로, 에이전트 하네스 (Agent harnesses), 도구 호출 (Tool calling), 코드 컴파일 (Code compilation) 등을 위한 Vera CPU의 높은 싱글 스레드 성능 (Single-threaded performance)과 결합하여, 핵심 추론 작업에 대한 Rubin GPU의 성능 향상 및 칩 내부와 랙 (Rack) 전체에 걸친 데이터 이동 효율성 개선은 Nvidia가 구상하는 점점 더 에이전트화되는 (Agentic) 미래에 추론 성능을 높이는 동시에 토큰당 추론 비용을 낮추는 랙 규모 (Rack-scale) 및 데이터 센터 규모 (Data-center-scale) 시스템 구축을 도울 것으로 기대됩니다. 올가을 Vera Rubin 시스템의 인도가 시작될 예정인 만큼, 이 GPU가 보여줄 더 많은 기능이 매우 기대됩니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Tom's Hardware의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기