Nvidia, AI 에이전트로 칩 엔지니어링 가속화
요약
Nvidia의 Tim Costa 부사장은 AI 에이전트가 칩 엔지니어링 복잡성을 해결하는 핵심 열쇠라고 강조했습니다. 그는 미래 반도체 산업의 폭발적인 성장에 따라 전통적 설계 방식으로는 한계에 도달했으며, AI를 통합하여 전체 엔지니어링 루프를 가속화해야 한다고 설명합니다.
핵심 포인트
- AI는 칩 개발 프로세스의 근본적인 인프라로 이동 중이다.
- 전통적 방법론은 미래 반도체 산업의 복잡성을 따라가지 못한다.
- Nvidia는 AI 에이전트와 Agent Toolkit을 통해 엔지니어링 과정을 가속화한다.
- Cadence, Synopsys와 협력하여 자체 Arm 기반 CPU(Vera)를 개발 중이다.
HPC
Nvidia, AI 에이전트로 칩 엔지니어링 가속화
10년도 더 전에 Nvidia는 인공지능에 전념했고, 그 이후로 GPU뿐만 아니라 CPU와 같은 AI 시스템 구동용 하드웨어와 CUDA-X 및 Nemotron이라는 이름 아래의 다양한 AI 모델을 제공해 왔다. 이는 Nvidia를 기업 및 HPC 데이터센터 개발을 장악한 급성장하는 AI 산업의 리더 위치에 놓았고, 회사를 엄청나게 부유하게 만들었다.
이러한 부를 이끄는 요인 중 하나는 AI용 실리콘 엔지니어링이 세대가 거듭될수록 점점 더 복잡해지고 있다는 점이다. 수요가 단순히 더 많은 칩뿐만 아니라 더 많은 역량에 대한 것이어서, 이는 산업을 전통적인 방법으로는 처리할 수 없는 지점으로 밀어내고 있다. Nvidia의 컴퓨테이셔널 엔지니어링 부문 부사장 겸 총괄 관리자인 Tim Costa는 이를 단순히 수요를 충족시키기 위한 스케일링 이상의 관점에서 설명했다.
영상 통화로 기자들과 대화하며, 코스타는 2030년까지 이 산업이 2조 개의 칩을 생산하고 매월 약 41백만 웨이퍼를 처리할 것으로 예상된다고 언급했다. 게다가 개별 패키지는 1조 트랜지스터에 근접하고 있으며, 전체 컴퓨팅 시스템은 수천 조 단위의 트랜지스터 수를 향해 나아가고 있다. 동시에, 칩을 시장에 출시하는 데는 엔지니어들이 시뮬레이션, 검증 및 구현 단계에 몇 년을 보내기 때문에 수년이 걸릴 수 있다. 이는 AI의 가속화된 시대에는 평생이라는 시간이다.
복잡성이 전통적인 칩 설계 능력을 초과하다
그는 “핵심은 어느 한 가지 숫자가 아니라, 스케일(scale), 아키텍처(architecture), 패키징(packaging), 시스템 복잡성의 상호작용”이라고 말했다. “전통적인 설계 프로세스는 이러한 규모의 도전에 따라가지 못한다. 이를 충족시키기 위해 AI와 가속 컴퓨팅은 생산성 도구에서 근본적인 엔지니어링 인프라로 이동하고 있다.”
이것이 바로 Nvidia와 다른 칩 엔지니어링 회사들이 AI에 주목하는 지점이다.
“이러한 복잡성은 반도체 혁신의 결합된 종단 간(end-to-end) 특성으로 인해 더욱 가중된다”고 Costa는 말했다. “칩 아키텍처에서의 결정은 원자 단위 제조, 첨단 패키징 전력, 열 관리(thermals), 그리고 전체 시스템의 동작에 영향을 미친다. AI는 엔지니어들이 훨씬 더 많은 설계 대안을 탐색하고 이러한 상호 작용 전반에서 더 나은 결정을 내리도록 돕는다. 가속 컴퓨팅(Accelerated computing)은 이러한 결정 뒤에 숨겨진 고충실도 시뮬레이션, 검증 및 최적화 과정을 반복할 수 있을 만큼 빠르게 만든다.”
그는 물리 법칙이나 설계 규칙을 대체하는 것이 아니라, AI를 칩 개발 프로세스에 통합하여 엔지니어들이 그러한 검사를 루프 안에 넣고 더 자주 사용할 수 있게 한다고 설명하며, “기회는 고립된 도구가 아닌 전체 엔지니어링 루프를 가속화하는 것이다”라고 덧붙였다.
Nvidia는 또한 엔지니어링 AI의 학습 및 배포를 위해 업데이트된 CUDA-X와 PhysicsNeMo 라이브러리를 포함하도록 Agent Toolkit을 확장하고 있다.
게다가, 이 공급업체는 칩 엔지니어링 회사인 Cadence와 Synopsys와 협력하여 자체 Arm 기반 “Vera” CV100 CPU(아래)를 사용하여 차세대 CPU 및 GPU 가속화에 힘쓰고 있다.
Vera는 Nvidia가 설계한 88개의 맞춤형 “Olympus” CPU 코어와 1.2 TB/sec의 LPDDR5X 메모리 서브시스템을 갖추고 있다. Nvidia에 따르면, 이 회사의 2세대 확장 가능한 일관성 패브릭(Scalable Coherency Fabric) 메시 인터커넥트는 강력한 코어별 성능, 높은 메모리 대역폭 및 엔지니어링 애플리케이션을 위한 낮은 지연 시간을 제공한다.

코스타는 “Nvidia가 시뮬레이션, 포멀 검증(formal verification), 물리적 구현을 포함하여 차세대 CPU 및 GPU를 만드는 데 사용되는 EDA [전자 설계 자동화] 워크플로우 전반에 걸쳐 Vera를 배포하고 있다”고 말하며, 초기 엔지니어링 테스트 결과 Vera가 Synopsys의 VCS와 Cadence의 Jasper 플랫폼에서 AMD Epyc Torrent 시스템보다 1.5배 높은 성능을 제공한다고 언급했다. “이것의 실질적인 가치는 시뮬레이션 검증 실행 시간이 단축된다는 것이다. 엔지니어링 팀은 더 빠르게 반복할 수 있다. 우리는 Cadence 및 Synopsys와 협력하여 Vera가 Rosa 설계 지원에 활용되도록 최첨단 EDA 애플리케이션을 최적화하고 있다.”
물론 ‘Rosa’는 Nvidia의 Rigel 코어를 기반으로 하는 차세대 CPU이다. 이 제품은 공급업체의 다가오는 Feynman 데이터센터 플랫폼의 일부로 2028년에 출시될 예정이다.
Cadence와 Synopsys 모두 자신들의 EDA 및 기타 칩 설계 역량에 에이전트 AI(agentic AI)를 적극적으로 활용하고 있다. Cadence는 지난 2월 실리콘 설계 및 검증을 위한 에이전트 도구인 AI Super Agent를 발표했으며, 그 다음 두 달 동안에는 칩 및 시스템 설계를 위해 AI 에이전트를 사용하는 Nvidia, TSMC, Google과의 파트너십을 공개했다. 지난달에는 자동화된 칩 설계 및 검증을 위한 프론트엔드 에이전트 워크플로우를 위한 AuraStack AI Super Agent(아래)가 출시되었다.
Cadence에 따르면, 이 AI Super Agents는 엔지니어의 지시에 따라 수백 개의 시뮬레이션을 동시에 구현하여 현재 5주가 걸리는 작업을 하루도 안 되는 시간 안에 처리할 수 있으며, 이는 레지스터 전송 수준(RTL) 검증 주기를 40배 빠르게 제공한다.
한편 Synopsys는 Nvidia와 파트너십을 맺었을 뿐만 아니라, 이번 주 AMD, Microsoft, Intel과 유사한 에이전트 기반 AI 협력을 발표했습니다. 이번 주 캘리포니아에서 열린 Design Automation Conference에서 Synopsys는 자체 에이전트 플랫폼 및 AgentEngineer 기술을 기반으로 하며 Nvidia의 새로운 Nemotron 3 Ultra 모델, Agent Toolkit, OpenShell 런타임과 같은 Nvidia 기술을 포함하는 완전 자율 설계 검증 워크플로우(Fully Autonomous Design Verification Workflow)(아래)를 시연했습니다. 이 공급업체는 다른 플랫폼보다 50배 빠르게 검증된 RTL을 제공할 수 있다고 밝혔습니다.
Nvidia는 지난 3월 Nemotron 모델과 OpenShell 런타임을 핵심 구성 요소로 하는 Agent Toolkit을 출시했으며, 한 달 전에는 칩 설계를 위한 에이전트 코딩용 오픈 모델인 Nemotron 3 Ultra를 공개했습니다. 이제 이 공급업체는 에이전트가 설계 및 시뮬레이션 작업을 위해 AI 물리 모델을 학습하고 배포할 수 있도록 재구축된 PhysicsNeMo를 포함하여 툴킷을 확장하고 있습니다.
Costa는 “PhysicsNeMo는 전문가들이 AI 물리학용 AI 모델을 구축, 학습 및 배포하는 데 도움을 주는 프레임워크로 시작했습니다. 우리는 이제 그 전문 지식을 에이전트가 사용할 준비가 된 기술(skills)을 가진 개방적이고 조합 가능한 라이브러리 모음으로 구성하고 있습니다. 이 라이브러리는 물리 인식 연산, GPU 네이티브 메시 처리, 분산 학습 및 데이터 큐레이션과 같은 실질적인 계층 및 엔지니어링 워크플로우 요구 사항을 다루며, 모델 가속화, 학습 레시피 구성, 데이터 파이프라인 생성 또는 데이터 세트 큐레이션을 포함한 작업에 대한 반복 가능한 지침을 인코딩하는 기술(skills)을 제공합니다. 여기에는 어떤 도구를 호출할지, 어떤 출력을 생성할지, 그리고 결과를 어떻게 확인해야 하는지가 포함됩니다.”라고 말했습니다.
그는 또한 “변화의 방향은 전문가가 수동으로 작동하던 프레임워크에서 에이전트가 더 큰 엔지니어링 프로세스 내에서 호출하고, 조합하며, 검증할 수 있는 AI 물리학 기능으로 이동하는 것입니다.”라고 덧붙였습니다.
CUDA-X는 EDA(Electronic Design Automation) 및 과학 시뮬레이션에 핵심적인 대규모 복잡 희소 선형 시스템을 위한 cuDSS의 직접 희소 솔버 가속 라이브러리를 포함했으며, 장치 수준의 요구 사항을 충족하는 규모로 양자 화학 시뮬레이션을 위한 cuEST도 포함했습니다. 이제 GPU에서 물리 및 공학 시뮬레이션용 대규모 희소 선형 시스템을 위한 cuISS를 포함합니다.
코스타는 “많은 엔지니어링 애플리케이션은 편미분 방정식(partial differential equations)으로 시작한다”며, “이러한 방정식을 이산화(discretized)하거나 컴퓨터에서 계산할 준비가 된 형태로 만들면, 작업 부하는 종종 매우 큰 희소 선형 시스템이 된다. 직접 솔버는 여전히 필수적이지만... 메모리 효율성과 확장성을 위해 반복 방법(iterative methods)을 요구하는 많은 엔지니어링 애플리케이션들이 있다. cuISS는 GPU 네이티브의 반복 희소 솔버와 전처리 빌딩 블록(preconditioning building blocks)을 CUDA-X에 가져옵니다.”
AI 자동 생성 콘텐츠
본 콘텐츠는 The Next Platform의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기