
AMD와 Cerebras, 저지연·고처리량 AI 추론을 위한 파트너십 발표 — Helios 랙 스케일 인프라의 EPYC 프로세서와
요약
AMD와 Cerebras가 AI 추론 성능을 극대화하기 위한 파트너십을 발표했습니다. AMD의 EPYC 및 Instinct GPU 기반 Helios 인프라와 Cerebras의 Wafer-Scale Engine을 결합하여, 추론 단계별로 최적화된 분산형 컴퓨팅 플랫폼을 구축할 계획입니다.
핵심 포인트
- AMD Helios는 프롬프트 처리 및 대규모 컨텍스트 윈도우 담당
- Cerebras WSE는 메모리 대역폭 중심의 토큰 생성 단계 담당
- 추론 워크로드 최적화를 통해 와트당 토큰 수(T/s/W) 최대 5배 향상 기대
- 2026년 하반기 Cerebras Cloud를 통해 우선 제공 예정
AMD와 Cerebras Systems는 목요일, Helios 랙 스케일 인프라 내의 AMD EPYC 프로세서와 Cerebras의 Wafer-Scale Engine (WSE) 솔루션을 결합하는 플랫폼을 개발할 계획이라고 발표했습니다. 이 새로운 시스템은 AMD의 CPU 및 Instinct GPU의 저지연 (low latency) 특성과 Cerebras의 Wafer Scale Engine (WSE) 프로세서의 고처리량 (high throughput) 특성을 결합할 것을 약속합니다.
AMD와 Cerebras는 EPYC CPU와 Instinct MI400 시리즈 가속기가 탑재된 AMD Helios 랙을 기반으로 하는 이 새로운 인터-랙-스케일 (inter-rack-scale) 플랫폼이 프롬프트 처리 (prompt processing) 및 대규모 컨텍스트 윈도우 (large context windows)를 담당하는 반면, Cerebras의 WSE는 메모리 대역폭 집약적인 토큰 생성 (token-generation) 단계를 처리할 것으로 기대하고 있습니다.
AMD와 Cerebras는 추론 워크로드의 서로 다른 부분을 각 아키텍처에 최적화하여 할당함으로써, 이 분산형 추론 (disaggregated inference) 플랫폼이 와트당 초당 토큰 수 (tokens per second per watt, T/s/W)를 최대 5배 더 높게 제공할 것으로 기대합니다. 따라서 AMD Helios는 랙 스케일 컴퓨팅 용량과 대량의 복잡한 요청을 제공하는 반면, Cerebras WSE는 지연 시간에 민감한 토큰 생성을 처리합니다. 두 컴퓨팅 플랫폼은 단일 추론 워크플로우 내에서 작동하게 되지만, 양사는 추가적인 성능 데이터를 공개하거나 시스템이 어떻게 상호 연결될지에 대해서는 설명하지 않았습니다.
AMD + Cerebras 플랫폼의 기본 아이디어는 본질적으로 Nvidia의 CPX 개념과 동일하지만, AMD와 Cerebras는 특화된 하드웨어를 반대되는 추론 단계에 할당합니다.
Nvidia의 분산형 (disaggregated) 설계는 추론을 컨텍스트/프리필 (context/prefill)과 생성/디코드 (generation/decode)로 분리합니다. GDDR7을 탑재하여 취소된 Rubin CPX GPU는 연산 집약적인 컨텍스트/프리필 단계에 특화되어 최적화된 반면, 일반적인 HBM 탑재 Rubin GPU는 메모리 대역폭 제한적인 생성 단계를 처리합니다.
이와 대조적으로, AMD와 Cerebras 플랫폼은 동일한 분리 (disaggregation) 원칙을 따르지만, 특화된 역할은 반대로 되어 있습니다. Instinct GPU를 탑재한 AMD의 Helios 플랫폼은 프리필 (prefill) 단계를 처리하며 프롬프트와 대규모 컨텍스트 윈도우 (context windows)를 처리하는 반면, Cerebras WSE는 디코드 (decode) 단계를 맡아 지연 시간에 민감한 토큰 생성 (token generation)을 처리합니다.
Cerebras는 자사의 데이터 센터에 AMD Helios 시스템을 설치하고 이를 자사의 WSE 랙과 통합할 계획입니다. 양사에 따르면, 이 결합된 솔루션은 2026년 하반기에 Cerebras Cloud를 통해 우선적으로 제공될 예정입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Tom's Hardware의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기