
Nvidia, AI 데이터 센터용 Vera CPU 심층 분석 — SPEC CPU 2026 벤치마크 공개, Olympus 아키텍처 상세 정보 및
요약
Nvidia가 데이터 센터 시장 공략을 위해 개발한 커스텀 CPU 'Vera'의 Olympus 아키텍처와 SPEC CPU 2026 벤치마크 결과를 분석합니다. Vera는 기존 x86 경쟁사와 차별화된 설계를 통해 AI 인프라 확장에 최적화된 성능을 목표로 합니다.
핵심 포인트
- Nvidia 최초의 커스텀 코어 디자인인 Olympus 아키텍처 적용
- SPEC CPU 2026 벤치마크를 통해 AMD Epyc 9755와 성능 비교
- 에이전틱 AI 수요에 대응하기 위한 차세대 AI 인프라 전략
- 올해 하반기 일반 가용성(GA) 단계 진입 예정
Nvidia의 Vera CPU는 데이터 센터 CPU 시장의 주요 플레이어가 되기 위한 첫 번째 시도입니다. Grace가 어느 정도 성공을 거두긴 했지만(특히 Meta에서의 Grace 단독 배포가 가장 눈에 띕니다), Vera는 Nvidia 최초의 커스텀 코어 디자인을 적용한 CPU입니다. 또한, 에이전틱 AI (agentic AI) 수요에 힘입어 지난 몇 달 동안 서버 CPU 시장이 폭발적으로 성장하고 있는 만큼, Vera는 매우 이상적인 시기에 등장하고 있습니다.
Vera는 클라우드 시장에서 AMD와 Intel의 점유율을 조금씩 깎아먹기 위해 만들어진 칩이 아닙니다. 하이퍼스케일러(hyperscalers)들이 기존의 레거시 클라우드를 넘어 AI 인프라를 확장하려 함에 따라, 확장되는 시장 내에서 점유율을 확보하기 위해 구축되었습니다. 따라서 Vera는 Nvidia의 x86 경쟁사들과는 훨씬 다른 방식으로 설계되었으며, 수많은 Arm 기반 설계들과 비교해도 몇 가지 독특한 아키텍처 설계 포인트를 보유하고 있습니다.
Nvidia는 올해 하반기로 예정된 일반 가용성 (general availability) 단계를 향해 나아가면서 Vera에 대한 세부 정보를 서서히 공개해 왔습니다. 이제 우리는 이 칩의 전체적인 모습을 파악할 수 있게 되었습니다. Nvidia는 Vera 화이트 페이퍼 (white paper)와 함께, Vera를 AMD의 Turin 기반 Epyc 9755와 비교한 비공식 SPEC CPU 2026 결과값을 공유했습니다.
여기에서 우리는 Olympus 코어에 대한 모든 세부 사항과 Nvidia가 실행한 벤치마크를 포함하여 화이트 페이퍼를 분석해 볼 것입니다. 이 글의 마지막 부분에서는 Vera의 더 넓은 맥락과, 단독 배포와 비교했을 때 Vera가 Nvidia의 광범위한 AI 생태계에 어떻게 부합하는지에 대해서도 간략히 살펴볼 것입니다.
Vera의 기술적 역량과 Nvidia의 차세대 AI 인프라 비전에 대해 이미 많은 논의가 이루어졌습니다. 가장 중요한 것부터 시작해 봅시다. 바로 벤치마크입니다.
Nvidia Vera CPU 벤치마크
우리는 이전에 Phoronix가 Nvidia 본사에서 실행한 선별된 벤치마크를 통해 Vera가 작동하는 모습을 본 적이 있습니다. Vera 백서(white paper)에서 Nvidia는 SPEC CPU 2026, 특히 SPECrate의 정수(integer) 스위트에 대한 벤치마크를 AMD의 Epyc 9755와 비교하여 공유했으며, 두 칩 모두 듀얼 소켓(dual-socket) 구성으로 실행되었습니다. 결과에 들어가기에 앞서, SPEC 실행 방식과 그에 대한 보고 기준에 관한 몇 가지 중요한 참고 사항이 있습니다.
Nvidia의 이번 실행은 공식적인 것이 아닙니다. Vera가 아직 널리 보급되지 않았기 때문에 참조 시스템(reference system)에서 테스트되었기 때문입니다. Vera는 올해 하반기에 일반 출시(general availability)를 준비하고 있습니다. 이로 인해 Nvidia는 직접 결과를 보고할 수 없습니다. 아래 차트 중 일부에 "추정치(estimated)"라고 표시된 이유가 바로 이것입니다. Nvidia는 SPEC CPU 2026을 실제로 실행했습니다. 이는 AMD가 출시 예정인 Venice 칩을 통해 지금까지 보여준 방식처럼 예상 성능을 외삽(extrapolating)한 것이 아닙니다.
SPEC CPU 2026은 네 가지 스위트로 나뉘어 있지만, Nvidia는 정수 기반 워크로드(workload)의 시스템 처리량(throughput)에 초점을 맞춘 SPECrate 정수 스위트를 테스트했습니다. "rate" 결과는 일정 시간 내에 얼마나 많은 작업이 완료되는지를 살펴봅니다. 여기에서는 시스템의 각 스레드(thread)가 워크로드의 복사본을 가집니다. 점수는 해당 워크로드가 완료되는 데 걸리는 시간이며, 자연스럽게 스레드 수와 관계없이 코어 수가 더 많은 칩이 유리하게 작용합니다.
해당 제품군에 포함된 벤치마크에 대한 더 자세한 정보를 원하신다면, 저희의 SPEC CPU 2026 원문 보도 내용을 꼭 확인해 보시기 바랍니다. 전체 결과는 다음과 같습니다:
<table><tbody><tr><td class="firstcol "><p><strong>테스트 (Test)</strong></p></td><td><p><strong>실행 시간 (Run Time)</strong></p></td><td><p><strong>비율 (Rate)</strong></p></td></tr><tr><td class="firstcol "><p>706.stockfish_r</p></td><td><p>324</p></td><td><p>1370</p></td></tr><tr><td class="firstcol "><p>707.ntest_r</p></td><td><p>251</p></td><td><p>830</p></td></tr><tr><td class="firstcol "><p>708.sqlite_r</p></td><td><p>250</p></td><td><p>744</p></td></tr><tr><td class="firstcol "><p>710.omnetpp_r</p></td><td><p>203</p></td><td><p>842</p></td></tr><tr><td class="firstcol "><p>714.cpython_r</p></td><td><p>136</p></td><td><p>1240</p></td></tr><tr><td class="firstcol "><p>721.gcc_r</p></td><td><p>296</p></td><td><p>817</p></td></tr><tr><td class="firstcol "><p>723.llvm_r</p></td><td><p>196</p></td><td><p>909</p></td></tr><tr><td class="firstcol "><p>727.cppcheck_r</p></td><td><p>142</p></td><td><p>890</p></td></tr><tr><td class="firstcol "><p>729.abc_r</p></td><td><p>196</p></td><td><p>823</p></td></tr><tr><td class="firstcol "><p>734.vpr_r</p></td><td><p>199</p></td><td><p>815</p></td></tr><tr><td class="firstcol "><p>735.gem5_r</p></td><td><p>131</p></td><td><p>1300</p></td></tr><tr><td class="firstcol "><p>750.sealcrypto_r</p></td><td><p>231</p></td><td><p>816</p></td></tr><tr><td class="firstcol "><p>753.ns3_r</p></td><td><p>129</p></td><td><p>1670</p></td></tr><tr><td class="firstcol "><p>777.zstd_r</p></td><td><p>469</p></td><td><p>483</p></td></tr><tr><td class="firstcol "><p><strong>전체 기본 점수 (Overall base score)</strong></p></td><td></td><td><p><strong>925</strong></p></td></tr></tbody></table>Nvidia는 테스트한 9755의 전체 점수인 898점을 제외하고는 정확한 결과치를 공유하지 않았습니다. 해당 전체 점수를 고려하면, Vera는 9755보다 3% 앞서 있습니다. 여기서 주목할 점은 Vera가 스레드(thread) 수의 큰 열세에도 불구하고 앞서고 있다는 것입니다. 듀얼 소켓(dual-socket) Epyc 9755 시스템의 전체 점수 898점은 공개적으로 제출된 SPEC CPU 2026 실행 결과와 비교했을 때, 더 높은 결과들이 발표되긴 했으나 불합리한 수치는 아닙니다. SPEC CPU는 소스 코드 형태로 제공되며, 테스터는 자신이 선택한 컴파일러로 이를 컴파일해야 하는데, 이는 결과에 큰 영향을 미칠 수 있습니다 (특히 벤더 전용 컴파일러의 경우). Nvidia는 두 시스템 모두에 GNU 15.2를 사용했습니다.

(이미지 출처: Nvidia)
위에서 Vera의 결과를 9755와 나란히 비교해 볼 수 있지만, 이는 수치를 직접적으로 비교하는 방식은 아닙니다. Nvidia는 코어당 성능(per-core performance)을 정규화(normalize)했는데, 이는 일반적으로 SPECrate 결과가 공유되는 방식이 아닙니다. 전체 수치에 따르면, Vera는 스레드 수의 열세에도 불구하고 동일한 시간 내에 더 많은 작업을 완료하고 있지만, 그 격차는 위 차트가 시사하는 것처럼 70% 또는 80% 수준의 우위 범위에 있지는 않습니다.
우리는 결과가 비교를 통해 모호하게 처리된 점에 대해 Nvidia에 문의했습니다. Nvidia가 제공한 정보만으로는 Epyc 9755의 점수를 역공학(reverse-engineer)할 수 없었습니다. 이에 대한 Nvidia의 답변은 다음과 같습니다: "소켓이 완전히 로드된 상태에서의 코어당 성능은 에이전트형 AI (agentic AI) 및 강화학습 (RL)이 많은 샌드박스 (sandboxes)를 동시에 실행하는 반면, 각 에이전트 단계는 순차적이고 지연 시간에 민감하기 때문에 중요합니다. 이는 공유 전력, 메모리, 캐시 및 패브릭 (fabric)에 대한 경합 속에서 각 코어가 얼마나 많은 성능을 유지하는지를 측정합니다. 따라서 우리는 두 시스템 모두에서 SMT (Simultaneous Multithreading)를 활성화한 상태로 물리 코어(physical core) 기준으로 정규화했습니다."
Nvidia가 여기서 강조한 "에이전트형 (agentic)" 워크로드는 코드 컴파일(code compilation) 및 인터프리터(interpretation) 워크로드로, 이는 에이전트가 종종 수행하는 작업인 저장소(repos)에서 의존성을 쿼리하고 소스 코드를 빌드하는 작업과 관련이 있습니다. 그 아래에는 데이터 과학 워크로드(또는 탐색적 데이터 분석 (Exploratory Data Analysis))가 있으며, 그 아래에는 SQLite 데이터베이스 관리와 같은 데이터 처리(data processing) 워크로드가 있습니다. 여기서의 결과는 Vera가 데이터가 풍부한 백엔드(backend) 작업에 매우 능숙하다는 Nvidia의 전반적인 메시지와 일치합니다.
Nvidia는 스레드당(per-thread) 결과를 공유하고 있지만, SPECrate가 여전히 실행하기에 적절한 벤치마크라고 주장합니다. 여기서의 스레드당 결과는 완전히 로드된 소켓(fully-loaded socket)의 맥락에서 산출되었습니다. 백서(white paper)에 명시된 근거는 다음과 같습니다: "이 지표는 많은 샌드박스(sandboxes), 도구, 환경이 격리된 단일 스레드 테스트가 아닌 동시에 실행되는 에이전트형 AI 및 강화학습 (RL) 시스템에 있어 매우 중요합니다. 완전히 로드된 코어당 성능은 각 코어가 소켓 수준의 전력, 메모리 대역폭(memory bandwidth), 캐시(cache) 및 패브릭(fabric) 리소스를 공유하는 동안 처리량(throughput)을 얼마나 잘 유지하는지를 포착합니다."

Nvidia

Nvidia

Nvidia

Nvidia

Nvidia
워크로드를 실행하는 것 외에도, Nvidia는 아키텍처 벤치마크를 위한 코드 실행을 분석했으며, 이는 위 갤러리에서 확인할 수 있습니다. Nvidia는 Turin 대비 전체 IPC(Instructions Per Cycle)가 최대 1.9배 향상되었고, 분기 예측(branch predictions)은 최대 2.3배, 사이클당 실행된 분기(taken branches per cycle)는 최대 3.5배, 사이클당 명령어 인출(instruction fetch) 작업은 최대 2.4배 더 높다고 주장합니다.

Nvidia

Nvidia
SPEC 외에도, Nvidia는 Olympus 코어의 역량을 강조하는 몇 가지 벤치마크를 공유했습니다. 첫 번째는 원래 웹 페이지 순위를 매기기 위해 Google에서 개발한 알고리즘인 PageRank로, 이는 Olympus의 프리페치 엔진(prefetch engine)을 강조합니다. Nvidia는 이 워크로드를 더 높은 코어 수로 확장했으며, Turin 칩이 약 20개 코어 부근에서 한계에 부딪히는 반면, Vera는 32개 코어까지 싱글 코어 성능의 상당 부분을 유지함을 보여주었습니다.
위의 결과 외에도, Nvidia는 Turin과 비교한 Vera 메모리 시스템의 몇 가지 테스트 결과를 공유했습니다. 이러한 마이크로벤치마크 (microbenchmarks)는 Nvidia의 사양을 검증하는 데 유용하지만, 애플리케이션 성능 (application performance)이 아닌 아키텍처 성능 (architectural performance)을 살펴보는 것입니다. 아키텍처상의 이점은 성능상의 이점으로 이어지지만, 항상 선형적이거나 예상 가능한 방식으로 나타나지는 않습니다.
Nvidia는 메모리 테스트를 위해 내부적으로 개발된 도구를 사용했으나, 이는 GitHub에서 누구나 실행할 수 있도록 공개되어 있습니다.

(이미지 출처: Nvidia)
첫 번째는 로드된 메모리 지연 시간 (loaded memory latency)으로, 대역폭 (bandwidth) 사용량이 증가함에 따라 메모리 서브시스템 (memory subsystem)에 부하를 주는 테스트입니다. Vera는 전반적으로 훨씬 더 높은 대역폭을 보유하고 있지만, Turin 칩은 최대치에 도달하기 전 지연 시간의 벽 (latency wall)에 부딪히는 것을 볼 수 있습니다. Nvidia는 이를 비균등 메모리 액세스 (Non-Uniform Memory Access, NUMA) 도메인 트래버설 (traversal) 및 CCD 간 지연 시간 (CCD-to-CCD latency) 때문이라고 설명합니다.

(이미지 출처: Nvidia)
코어당 대역폭 (per-core bandwidth)을 살펴보면, Nvidia는 Vera가 AMD 9755보다 4배 이상의 대역폭을 제공한다고 주장합니다. 여기서 시사하는 바는 "실제" 코어당 대역폭이 Nvidia의 사양보다 훨씬 더 좋거나 (또는 아마도 AMD의 사양보다 더 나쁠 수도 있다는 점입니다).

(이미지 출처: Nvidia)
이 테스트들 중 아마도 가장 중대한 것은 위에서 볼 수 있는 코어 간 지연 시간 (core-to-core latency) 테스트일 것입니다. AMD의 칩렛 (chiplet) 기반 아키텍처에서 CCD를 가로지르는 것이 큰 지연 시간 페널티 (latency penalty)를 초래한다는 것은 비밀이 아닙니다. 이는 당사의 Ryzen 9 9950X3D2 리뷰에서도 확인할 수 있으며, CCD의 수가 늘어남에 따라 이러한 페널티는 복리로 증가합니다.
AMD의 입장을 공정하게 고려하자면, 칩렛 (chiplet) 기반 설계는 이러한 유형의 CCD 간 트래버설 (cross-CCD traversal)을 위해 만들어진 것이 아니며, 워크로드를 국소화하고 코어 밀도 (core density)를 최적화하는 것을 선호합니다. Vera의 설계 목표는 다이 (die) 전체에서 지연 시간 (latency)을 일정하게 유지하는 것이 분명하며, 그 과정에서 코어 밀도를 희생하고 있습니다. 최근 저희가 Nvidia 본사를 방문했을 때, Nvidia의 Ian Buck은 이러한 설계 트레이드오프 (trade-off)가 "기존 워크로드 (legacy workload)의 희생을 수반할 것"이라고 말했습니다.
이는 중요한 맥락입니다. Nvidia는 AMD나 Intel로부터 기존 시장 점유율을 뺏어오는 것보다, AMD와 Intel이 선점하기 전에 확장되는 시장에서 점유율을 확보하려는 데 주력하고 있습니다. 일부 금융 기관(Morgan Stanley 및 Bank of America 포함)은 서버 CPU 시장 규모가 2030년까지 두 배로 커지거나(또는 그 이상으로 성장할 수 있다고) 제안합니다. 이러한 맥락이 중요한 이유는 Vera가 최적화되지 않은 워크로드를 처리할 수 있는 CPU에 대한 수요가 지속될 것이기 때문이며, AMD와 Intel이 기존 고객층을 유지하면서 확장된 시장으로 나아가려 노력하는 과정에서 이러한 역학 관계를 향후 제품들로 어떻게 해결해 나갈지 지켜보는 것은 흥미로운 일이 될 것입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Tom's Hardware의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기