
AMD의 256코어 Epyc 9996 'Venice', Intel Xeon 및 Nvidia Vera 대비 최대 3.4배 성능 향상 주장 –
요약
AMD가 Zen 6 아키텍처를 기반으로 한 새로운 Epyc 9996 'Venice' 프로세서를 공개했습니다. 이 칩은 최대 256코어와 512스레드를 지원하며, Intel Xeon 및 Nvidia Vera 대비 압도적인 성능 향상을 목표로 합니다.
핵심 포인트
- Zen 6 아키텍처 기반의 256코어/512스레드 Epyc 9996 공개
- Nvidia Vera 및 Intel Xeon 6 대비 최대 3.4배 성능 향상 주장
- SP7 소켓 기반 Venice 라인업 및 PCIe 6, MRDIMM 지원
- 내년 상반기 SP8 소켓 기반의 소규모 Venice 라인업 출시 예정
AMD가 1년 넘게 티징(teasing)해 온 첫 번째 Zen 6 CPU에 대한 세부 정보를 마침내 공개했습니다. Epyc 9996은 AMD의 새로운 Zen 6 아키텍처를 탑재한 256코어 / 512스레드 칩으로, AMD가 '광범위한 포트폴리오(broad portfolio)'라고 설명하는 Venice 라인업 중 가장 먼저 출시되는 제품입니다. AMD는 곧 출시될 Nvidia Vera 및 Intel의 Xeon 6에 비해 상당한 성능 우위를 점한다고 주장하는 동시에, 향후 1년 동안 맞춤형 설계를 통해 Venice 제품군을 계속 확장해 나갈 것이라고 밝혔습니다.
AMD의 컴퓨팅 및 엔터프라이즈 솔루션 부문 기업 부사장인 Ravi Kuppuswany는 "단일 프로세서가 아닙니다. 하나의 포트폴리오입니다"라고 말했습니다. AMD는 Intel이 지난 몇 세대에 걸쳐 Xeon 라인업을 분리해 온 방식(또는 AMD가 Epyc 제품군을 완만하게 세분화해 온 방식)과 유사하게, 애플리케이션에 따라 제품을 나누는 목적 기반 솔루션을 보유하고 있다고 설명합니다. 로드맵은 AMD가 오랫동안 예고해 온 SP7 소켓 기반의 주요 Venice 라인업으로 시작됩니다. 이 라인업은 최대 256코어 및 512스레드, 빠른 MRDIMM을 통한 1.6 TB/s의 메모리 대역폭, 그리고 1P 구성 시 128개의 PCIe 6 레인(2P 구성 시 160개 레인)까지 확장됩니다.

AMD

AMD

AMD

AMD
참고: 256코어까지 확장할 때 AMD는 Zen 6c '고밀도(dense)' 설계를 사용합니다. 표준 Zen 6 설계의 경우, AMD는 Venice가 최대 128코어 및 256스레드까지 확장 가능하며, 고주파(high-frequency) 변형 모델은 최대 96코어까지 지원한다고 밝혔습니다.
내년 상반기에 AMD는 더 작은 규모의 배포에 집중하여, 최소 8코어에서 최대 128코어까지 제공하는 SP8 소켓 기반의 Venice를 출시할 계획입니다. 이 칩들은 채널당 2개의 DIMM을 사용하는 8채널 메모리와 동일한 128개의 PCIe 6 레인을 지원합니다.
Venice-X는 2027년 하반기 SP7 소켓에서 출시될 예정입니다. Turin-X는 보지 못했지만, 바로 전 세대인 Genoa-X는 96코어와 최대 1152MB의 적층된 L3 캐시(stacked L3 cache)를 탑재했습니다. 해당 사양은 (Zen 6 마이크로아키텍처를 제외하면) 변경되지 않았으나, AMD는 Venice-X의 클럭을 최대 5.15 GHz까지 높일 수 있다고 밝히고 있습니다.
마침내, Verano는 내년 하반기에 SP8 소켓으로 출시될 예정이며, 이는 Vera의 가장 직접적인 경쟁자가 될 것으로 보입니다 (AMD의 Kuppuswamy는 이를
AMD는 Venice의 SKU 목록이나 상세 사양을 제공하지 않았습니다. 우리가 정말로 알 수 있는 것은 256코어의 고밀도 설계인 Epyc 9996뿐이며, 그마저도 많은 정보가 누락되어 있습니다. 하지만 이전의 루머와 보고서들을 확인해 주는 Venice에 관한 몇 가지 중요한 세부 사항들을 알게 되었습니다.
Zen 6는 TSMC의 N2 공정을 기반으로 구축됩니다 (이는 이전에 확인된 바 있습니다). AMD는 두 개의 IOD와 함께 CCD당 32개의 코어가 있음을 확인했습니다. 이때 32코어 CCD는 완전한 Zen 6가 아닌 Zen 6c를 사용한다는 점을 유념하십시오. 소비자용 Zen 6 CPU에 32코어 CCD가 탑재될 것이라는 추측이 많았으나, 그럴 가능성은 낮아 보입니다.
256코어 구성은 Epyc 9965의 거의 세 배에 달하는 거대한 1,024 MB의 L3 캐시를 제공합니다. 이는 적층형 캐시 (stacked cache)도 아닙니다; 적층형 캐시는 Venice-X와 함께 제공될 예정입니다. 각 CCD는 128 MB의 L3 캐시, 즉 코어당 4 MB의 캐시에 접근할 수 있으며, 이는 Turin에서 사용 가능했던 양의 두 배입니다.
AMD는 256코어 Venice에 대한 티저에 많은 초점을 맞추어 왔지만, 초기 SP7 제품군에는 최대 5 GHz까지 클럭을 높일 수 있는 96코어 고주파 모델도 포함될 것입니다.
AMD, 첫 256코어 Epyc ‘Venice’ 벤치마크 공개

AMD

AMD

AMD

AMD

AMD

AMD
몇 주 전에 AMD가 공유한 추정 성능과는 달리, 이제 우리는 Epyc 9996에 대한 구체적인 벤치마크를 보유하게 되었습니다. 예상대로 AMD는 워크로드(workloads)를 에이전틱 AI (agentic AI) 중심으로 구성했습니다. 그러나 에이전틱 AI에 적용 가능한 많은 워크로드들은 고동시성 네트워킹 작업 (high-concurrency networking tasks), 코드 컴파일 (code compilation), 미디어 처리 (media processing)를 포함하여 다른 분야에도 적용 가능합니다.
위 차트에서 AMD는 세대 간 비교 지점으로 Epyc 9965만을 포함했다는 점에 유의하십시오. 이는 192코어를 갖춘 “고밀도 (dense)” Zen 5 설계입니다. 128코어 9755에 대한 결과는 아래 표에 포함되어 있습니다.
프런트엔드 (front-end) 작업부터 시작하여, AMD는 WRK 부하 생성기 (load generator)를 사용하는 NGINX 웹 서버를 기준으로 전 세대 대비 1.2배, Intel Xeon 6980P 대비 2.8배의 성능 향상을 주장합니다. 이러한 대부분의 경쟁 성능 수치와 달리, AMD는 자신이 실행한 벤치마크의 실제 수치를 각주에 포함했으며, 이는 아래 표에서 확인할 수 있습니다.
<table><tbody><tr><td class="firstcol "><p><strong>Chip</strong></p></td><td><p><strong>Max Request Per Second</strong></p></td></tr><tr><td class="firstcol "><p>Intel Xeon 6980P</p></td><td><p>10,162,179</p></td></tr><tr><td class="firstcol "><p>AWS Graviton5</p></td><td><p>15,331,108</p></td></tr><tr><td class="firstcol "><p>AMD Epyc 9755</p></td><td><p>17,906,196</p></td></tr><tr><td class="firstcol "><p>AMD Epyc 9965</p></td><td><p>24,320,476</p></td></tr><tr><td class="firstcol "><p>AMD Epyc 9996</p></td><td><p>28,789,170</p></td></tr></tbody></table>AI 에이전트 사이에서 흔히 발생하는 데이터 집약적 (data-heavy) 워크로드에서, AMD는 Turn 대비 1.7배, Xeon 6980P 대비 무려 3.4배의 향상을 주장합니다. AMD는 이러한 결과를 수집하기 위해 TPCx-AI 벤치마크를 사용했습니다. 이 테스트의 주요 지표는 분당 AI 사용 사례 (AI use cases per minute, AIUCpm)이며, AMD는 이에 대한 중앙값 (median) 결과2를 공유했습니다. 이 벤치마크 보고에 대해 더 자세히 알고 싶다면, Dell에서 광범위한 분석 내용을 게시했습니다.
<table><tbody><tr><td class="firstcol "><p><strong class="">칩</strong></p></td><td><p><strong class="">AIUCpm</strong></p></td></tr><tr><td class="firstcol "><p>Intel Xeon 6980P</p></td><td><p>1,750.36</p></td></tr><tr><td class="firstcol "><p>AWS Graviton5</p></td><td><p>2,444.8</p></td></tr><tr><td class="firstcol "><p>AMD Epyc 9755</p></td><td><p>2,704.19</p></td></tr><tr><td class="firstcol "><p>AMD Epyc 9965</p></td><td><p>3,458.79</p></td></tr><tr><td class="firstcol "><p>AMD Epyc 9996</p></td><td><p>5,982.91</p></td></tr></tbody></table>벡터화된 워크로드(vectorized workloads)에서 AMD는 세대 대비 1.6배의 개선과 Xeon 6980P 대비 2.3배의 개선을 주장합니다. 이 테스트를 위해 AMD는 Meta의 오픈 소스 FAISS (Facebook AI Similarity Search) 라이브러리를 사용하여 siftm1 데이터셋에서 유사한 벡터를 검색했습니다. 여기서 측정 지표(metric)는 QPS, 즉 초당 처리되는 쿼리 수로 전체 쿼리 처리량(query throughput)을 나타냅니다.
<table><tbody><tr><td class="firstcol "><p><strong class="">칩</strong></p></td><td><p><strong class="">QPS</strong></p></td></tr><tr><td class="firstcol "><p>Intel Xeon 6980P</p></td><td><p>316,069</p></td></tr><tr><td class="firstcol "><p>AWS Graviton5</p></td><td><p>119,179</p></td></tr><tr class="firstcol "><p>AMD Epyc 9755</p></td><td><p>369,252</p></td></tr><tr class="firstcol "><p>AMD Epyc 9965</p></td><td><p>472,079</p></td></tr><tr class="firstcol "><p>AMD Epyc 9996</p></td><td><p>751,453</p></td></tr></tbody></table>“엔터프라이즈 도구(enterprise tools)” 벤치마크의 경우, AMD는 TPC-H, TPC-C, Redis를 포함한 여러 테스트를 실행했으며 그 결과를 “지오평균 처리량(geomean throughput)”으로 보고합니다. 여기에는 실제 수치가 있지만, 이는 단일 벤치마크라기보다는 여러 다른 테스트를 나타내는 지오평균입니다. 하지만 전반적으로 AMD는 이러한 워크로드에서 세대 대비 1.6배의 개선과 Intel 대비 2.6배의 개선을 주장합니다.
<table><tbody><tr><td class="firstcol "><p><strong>칩(Chip)</strong></p></td><td><p><strong>지오평균 처리량(Geomean throughput)</strong></p></td></tr><tr><td class="firstcol "><p>Intel Xeon 6980P</p></td><td><p>2,284,701</p></td></tr><tr><td class="firstcol "><p>AWS Graviton5</p></td><td><p>2,982,203</p></td></tr><tr><td class="firstcol "><p>AMD Epyc 9755</p></td><td><p>2,546,290</p></td></tr><tr><td class="firstcol "><p>AMD Epyc 9965</p></td><td><p>3,867,149</p></td></tr><tr><td class="firstcol "><p>AMD Epyc 9996</p></td><td><p>6,054,748</p></td></tr></tbody></table>많은 에이전트 기반 워크로드(agentic workloads)는 에이전트를 벗어나서도 적용 가능하지만, AMD는 몇 가지 에이전트를 직접 테스트하기도 했습니다. 이들은 칩 전반에 걸쳐 다섯 가지 다른 에이전트 페르소나를 재현했고, 다시 한번 처리량 지오평균을 수집했습니다. 저희가 여기에 메트릭이 없거나 이전 벤치마크에도 없기 때문에, AMD가 제공한 데이터로는 우리가 보고 있지 못한 성능 각도가 있을 수 있습니다.
그럼에도 불구하고, 이 회사는 이번 테스트에서 세대 대비 1.5배의 개선과 6980P 대비 2.5배의 개선을 주장합니다.
<table><tbody><tr><td class="firstcol "><p><strong>칩(Chip)</strong></p></td><td><p><strong>지오평균 처리량(Geomean throughput)</strong></p></td></tr><tr><td class="firstcol "><p>Intel Xeon 6980P</p></td><td><p>1.779</p></td></tr><tr><td class="firstcol "><p>AWS Graviton5</p></td><td><p>2.505</p></td></tr><tr><td class="firstcol "><p>AMD Epyc 9755</p></td><td><p>2.317</p></td></tr><tr><td class="firstcol "><p>AMD Epyc 9965</p></td><td><p>2.97</p></td></tr><tr><td class="firstcol "><p>AMD Epyc 9996</p></td><td><p>4.451</p></td></tr></tbody></table>AMD는 이달 초에 이러한 테스트를 수행했습니다. 하지만 불과 며칠 전, Nvidia는 Vera에 대한 첫 번째 SPEC CPU 2026 결과를 발표했습니다. AMD는 Vera와 Venice를 비교하기 위해 동일한 컴파일러(compiler)를 사용하여 자체적인 테스트를 몇 가지 수행했습니다. AMD의 Kuppuswamy는 "모든 것이 동일한 조건의 비교(apples-to-apples comparison)이며, 동일한 컴파일러를 사용했습니다"라고 말했습니다. 궁금하시다면, 해당 컴파일러는 GNU 15.2입니다.

(이미지 출처: AMD)
처리량(throughput) 측면에서, AMD는 256개의 Zen 6c 코어를 탑재한 고밀도 Venice 설계를 사용하는 Vera와 비교했을 때, SPECrate 정수(integer) 제품군에서 2.2배의 성능 향상이 있다고 주장합니다. 더 중요한 것은, AMD가 Vera를 96코어 "고주파수(High Frequency)" Venice 칩과 비교했을 때 코어당 성능(per-core performance)이 1.2배 향상되었다고 주장한다는 점입니다. AMD는 Nvidia의 결과를 비교의 기준으로 사용했다고 밝혔습니다. 두 Venice 설계 모두 AMD는 600W TDP를 사용했습니다.

(이미지 출처: AMD)
AI 자동 생성 콘텐츠
본 콘텐츠는 Tom's Hardware의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기