단일 데이터센터만으로는 부족할 때
요약
대규모 AI 모델 학습이 단일 데이터센터의 물리적 한계를 넘어 여러 사이트로 확장되면서, 기존 네트워크 설계로는 부족한 새로운 네트워킹 문제가 발생하고 있습니다. 이 인터뷰는 분산된 AI 인프라가 하나의 결정론적인 시스템처럼 작동하도록 만드는 방법과, 이를 위한 고속 일관성 옵틱스 및 통합 실리콘의 중요성을 다룹니다.
핵심 포인트
- AI 학습은 네트워크를 단순 전송 수단이 아닌 컴퓨트 핵심 요소로 변화시킵니다.
- 분산 클러스터는 단일 결정론적 머신처럼 작동하도록 설계되어야 합니다.
- 고속 일관성 옵틱스 및 통합 실리콘 기술이 장거리 AI 워크로드에 필수적입니다.
- 전력 효율성과 네트워크 소비 간의 상충 관계를 고려해야 합니다.
가장 큰 규모의 AI 모델을 학습시키는 것은 더 이상 단순히 GPU를 추가하는 문제에 그치지 않습니다. 클러스터가 커짐에 따라 전력 공급 가능성이 까다로운 물리적 제약이 되고 있으며, 이는 인프라 팀들이 단일 학습 워크로드가 여러 데이터센터에서 어떻게 작동할 수 있을지 고려하도록 강제하고 있습니다.
이는 매우 다른 네트워킹 문제를 야기합니다. 전통적인 데이터센터 상호연결(interconnect)은 사이트 간 트래픽을 이동시키도록 설계되었습니다. 하지만 AI 학습은 더 정밀한 것을 요구합니다: 거대하고 동기화된 흐름, 최소의 패킷 손실, 그리고 GPU 간에 긴밀하게 조정된 통신입니다. 클러스터의 한 부분이 멈추면 그 영향이 전체 작업으로 파급될 수 있습니다.
본 인터뷰에서 The Register의 Tim Phillips가 Rakesh Chopra, Cisco Fellow이자 SVP, Silicon and Systems Architecture와 'Scale-Across'라는 개념과 왜 분산된 AI 인프라가 라우팅에 대한 새로운 접근 방식을 필요로 하는지에 대해 이야기합니다.
Rakesh는 AI의 요구사항이 네트워크의 역할을 단순한 전송 수단에서 컴퓨트 시스템의 필수적인 부분으로 어떻게 변화시키고 있는지 설명합니다. 그는 지리적으로 분리된 시설들이 단일 결정론적(deterministic) 머신처럼 작동하도록 만드는 과제와, 워크로드가 장거리 광섬유 링크를 가로지를 때 버퍼링, 고속 일관성 옵틱스(coherent optics), 그리고 긴밀하게 통합된 실리콘이 왜 중요한지에 대해 논합니다.
대화는 클러스터 자체 내부도 살펴봅니다. Rakesh는 Cisco의 Silicon One 아키텍처와 Intelligent Collective Networking이 어떻게 동기화된 GPU 트래픽 버스트를 관리하고, 병목 현상을 줄이며, 작업 완료 시간을 개선하도록 설계되었는지 개괄합니다. 전력 효율성 또한 중심 주제로 다루어지며, 네트워크 소비와 GPU에 사용 가능한 에너지 사이의 상충 관계(trade-off)가 포함됩니다.
보안과 수명 주기(longevity)도 초점이 됩니다. 이 인터뷰는 하드웨어 가속 MACsec 및 IPsec뿐만 아니라, AI 워크로드가 계속 진화함에 따라 인프라가 적응하는 데 도움을 주는 프로그래밍 가능성(programmability)의 역할도 다룹니다.
더 크고 분산된 AI 환경을 계획하는 인프라 및 데이터센터 리더들을 위해, 본 논의는 하나의 사이트만으로는 충분하지 않을 때 발생하는 네트워킹 과제에 대한 실질적인 시각을 제공합니다.
전체 인터뷰는 아래를 확인하세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 The Next Platform의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기