성장통: 분산 AI 학습이 데이터센터 간 네트워크를 변화시키는 방식
요약
대규모 AI 모델 학습이 단일 데이터센터를 넘어 여러 지역의 클러스터로 분산되고 있습니다. 이는 컴퓨팅 및 전력 수요 한계를 극복하기 위함이며, 이 과정에서 GPU 간 동기화와 대용량 숫자 배열(기울기 등) 교환이 핵심 병목 현상으로 부각됩니다. 따라서 네트워크 지연을 최소화하는 것이 AI 학습의 필수 과제가 되었습니다.
핵심 포인트
- AI 학습은 단일 데이터센터를 넘어 분산 클러스터로 확장 중입니다.
- 대규모 모델 훈련 시 GPU 간 동기화 및 대용량 데이터 교환이 핵심 병목입니다.
- 네트워크 지연은 곧 컴퓨팅 지연으로 이어지므로 네트워크 최적화가 중요합니다.
- 인캐스트(incast)와 같은 트래픽 문제는 분산 학습 환경에서 해결해야 할 과제입니다.
대규모 AI 학습은 이미 단일 데이터센터의 경계를 벗어났습니다. Google은 Gemini가 여러 위치에 있는 클러스터 전반에 걸쳐 동기적으로 학습되었다고 밝혔으며, Microsoft는 위스콘신과 조지아에 있는 AI 데이터센터를 하나의 분산형 AI 슈퍼컴퓨터로 연결했습니다. AWS는 Anthropic이 Claude 모델을 구축할 수 있도록 광범위한 지역에 걸쳐 AI 컴퓨팅 클러스터를 연결했으며, Meta는 모델 학습을 지원하기 위해 고용량 데이터센터 상호연결망(interconnects)을 구축했습니다. 또한 CoreWeave와 Google Cloud는 최근 사설 상호연결망을 통해 크로스클라우드 학습을 발표했으며, Azure가 연말에 뒤따를 가능성이 높습니다.
모델 학습의 이러한 지리적 확산은 부분적으로 단일 데이터센터나 캠퍼스 클러스터의 한계 때문입니다. 이들은 새로운 모델이 요구하는 컴퓨팅 및 전력 수요를 충족시키려 할 때 과부하가 걸릴 수 있습니다. Cisco에 따르면, 오늘날 모델을 학습시키는 데는 수만 개의 GPU를 갖춘 클러스터가 필요할 수 있습니다. Epoch AI의 연구원들에 따르면, 2030년까지 가장 큰 개별 프론티어(frontier) 학습 실행은 4~16GW의 전력을 소비할 수 있습니다. 컴퓨팅을 분산하는 것은 하이퍼스케일러와 데이터센터 운영자들이 더 많은 가용 전력이나 공간이 있거나 계획 제약이 적은 위치에 구축할 수 있도록 합니다.
LLM 학습 방법
LLM의 핵심에는 수십억 개의 수치적 매개변수, 즉 가중치(weights)를 가진 신경망이 있으며, 이 가중치는 학습 중에 조정됩니다. 배치(batch) 형태의 훈련 데이터가 모델을 통과하면서 예측을 수행합니다. 시스템은 오차를 측정하고 가중치가 어떻게 변화해야 하는지 계산합니다. 이후 가중치를 업데이트하고 과정이 다시 시작됩니다. 현대 모델의 규모에서는 이러한 작업이 수천 개의 GPU와 AWS Trainium, Google TPU와 같은 다른 가속기 전반에 걸쳐 분산됩니다.
대규모 AI 학습 환경에서 GPU 간 통신 및 동기화 병목 현상
서로 다른 GPU들은 별도의 데이터 배치를 처리하거나 모델의 다른 부분을 처리할 수 있습니다. 하지만 이들이 완전히 독립적으로 작동할 수는 없습니다. 여러 지점에서 그들은 결과를 교환하고 동기화해야만 다음 훈련 단계가 시작될 수 있기 때문입니다.
액셀러레이터(accelerator)들 사이에서 네트워크를 통해 전송되는 것은 일반적으로 모델을 훈련하는 데 사용된 텍스트나 이미지가 아니라, 기울기(gradients)와 중간 결과(intermediate results) 같은 대규모 숫자 배열입니다. 수천 개의 액셀러레이터가 비슷한 시기에 이 데이터를 교환하고 결합해야 할 필요가 있습니다.
Cisco의 Silicon One 아키텍처 팀 소속 Ramesh Sivakolundu는 "어떤 훈련 작업이든 본질적으로 컴퓨팅과 동기화의 반복입니다"라고 설명합니다. "가중치(weights)를 계산한 다음, 이 가중치를 클러스터 내 모든 GPU에 전송하여 동기화하고, 그런 다음 계산을 재개하는 것입니다. 이는 훈련 과정 전체에 걸쳐 주기적인 간헐적 트래픽(bursty traffic)이 발생한다는 것을 의미합니다."
수천 개의 액셀러레이터가 컴퓨팅 단계를 완료하고 동시에 통신을 시작할 수 있습니다. 이는 많은 송신자가 동일한 목적지로 모이고 트래픽이 다음 링크가 처리할 수 있는 속도보다 빠르게 도착하는 "인캐스트(incast)" 문제로 이어질 수 있습니다.
근본적인 문제는 동기화에 있습니다. 동기식 훈련 작업(synchronous training job)에서는 한 그룹의 GPU가 느린 다른 그룹을 무시하고 독립적으로 계속 진행할 수 없습니다. 참여하는 GPU들이 다음 단계로 넘어가려면 네트워크 전체에서의 교환이 완료되어야 합니다. 따라서 네트워크 지연은 컴퓨팅 지연이 됩니다.
Sivakolundu는 "네트워크가 훈련 과정의 병목 현상이 되어서는 안 됩니다"라고 말합니다. "핵심 아이디어는 GPU들이 완전히 점유되도록 유지하고, 네트워크가 전체 훈련 프로그램에 추가적인 지연 시간(latency)을 유발하지 않게 하는 것입니다."
그렇다고 해서 네트워크 혼잡(network congestion)이나 패킷 손실(packet loss)의 모든 사례가 모델 학습 전체를 완전히 중단시킨다는 의미는 아닙니다. 하지만 지연되거나 손실된 흐름은 재전송을 요구할 수 있고, 집합적인 통신 작업(collective communication operation)을 길게 늘어지게 하며, 다른 가속기(accelerator)들을 기다리게 만듭니다. 더 심각한 오류는 학습이 저장된 체크포인트(checkpoint)로 돌아가야 할 수도 있습니다.
다양한 종류의 상호연결망 (Interconnect)
시스코(Cisco) 제품 관리 이사인 Itamar Gold는 “단일 데이터센터 내부에서는, 계획했던 대역폭으로 GPU 랙들을 연결하는 전체 네트워크를 구축했다고 가정할 수 있다”고 말합니다. 골드의 지적은 scale-across 방식의 조정된 AI 워크로드(AI workloads)가 각 시설 내부의 네트워크보다 더 제약적인 사이트 간 패브릭(inter-site fabric)을 통과해야 할 수도 있다는 것입니다. 대신, 그는 다른 시설로 향하는 트래픽이 사실상 더 좁은 파이프를 통해 집중될 수 있다고 말합니다. 동기화된 버스트(burst)는 그 파이프를 일시적인 병목 지점(choke point)으로 만들 수 있습니다.
전통적인 DCI(Data Center Interconnect)는 그렇지 않으면 독립적인 데이터센터 환경을 연결하며, 일반적으로 이중화(redundancy), 도달 범위(reach), 워크로드 분산(workload distribution)을 위해 구축됩니다. 이를 통해 흐르는 트래픽은 종종 복제 트래픽(replication traffic)이나 애플리케이션 데이터이며, 이러한 흐름들은 비동기적(asynchronous)입니다. 즉, 하나의 흐름이 다른 흐름들과 반드시 순차적으로 완료될 필요가 없습니다.
scale-across AI 학습에서는 사이트 간 네트워크가 단순히 독립적인 시스템들 사이에 데이터를 이동시키는 것이 아니라, 조정된 분산 컴퓨팅(distributed computation)의 일부가 됩니다. 따라서 충분한 대역폭과 예측 가능한 전송이 필수적입니다.
랙에서 리전까지 (From Rack To Region)
랙(rack) 내부에서는 대역폭 요구 사항이 엄청날 수 있습니다 – 최대 800 Gb/sec 및 1.6 Tb/sec에 달하지만, 거리는 짧습니다. 고속 직렬 레인(serial lanes)들이 결합하여 GPU 클러스터가 단일 컴퓨팅 유닛처럼 보이게 만듭니다. AI 패브릭이 전체 시설로 확장될 때도, “스케일 아웃(scale out)” 랙은 여전히 최대 1.6 Tb/sec의 연결을 필요로 합니다. 이러한 데이터 전송률에서는 구리(copper)가 일반적으로 짧은 거리에 국한됩니다. 랙 로우와 데이터센터 플로어 간의 연결에는 대신 플러그형 광학 장치(pluggable optics)를 사용하며, 스케일 아웃 링크는 수백 미터에서 약 2km까지 확장됩니다.
“스케일 어크로스(scale-across)”는 여러 시설에 걸쳐 조정된 AI 패브릭을 확장하여, 사이트 간 네트워크 동작이 워크로드 성능의 일부가 되게 합니다. 아키텍처에 따라 이러한 링크는 메트로 또는 지역적 거리를 가로지르거나, 아키텍처에 따라 더 멀리까지 걸칠 수 있습니다. Cisco가 모델링한 대규모 분산 AI 배포에 따르면, 총 집계 대역폭 요구 사항은 기존 DCI(Data Center Interconnect) 기준선의 약 14배에 달할 수 있습니다.
시작하자면, 단거리 데이터센터 광학 장치는 수백 킬로미터에 걸쳐 400-800 Gbps 신호를 전송하도록 설계되지 않았습니다. 이러한 거리에서는 운영자가 복잡한 변조(modulation)와 고성능 디지털 신호 처리(digital signal processing)를 사용하는 코히어런트 광학 장치(coherent optics)가 필요합니다. 이는 높은 전송률의 광 신호가 메트로 및 지역 광섬유 구간에서 사용 가능하도록 유지하며, 거리와 함께 더 두드러워지는 물리적 손상(physical impairments)을 보정해 줍니다. 포트 수 또한 중요합니다. Cisco는 두 개의 100 메가와트 AI 사이트를 연결하는 데 스케일 어크로스 계층에서 12,000개에서 32,000개의 코히어런트 광학 포트가 필요할 수 있다고 추정하며, 이는 비교 가능한 시설 간의 기존 DCI에 필요한 약 1,000개에서 2,000개와 비교됩니다. 400 Gb/sec 또는 포트당 800 Gb/sec 기준으로 계산하면, 이는 페타비트급의 총 집계 용량을 추가합니다.
이처럼 많은 데이터를 이동시키는 것은 전력 및 공간 문제이기도 합니다. Coherent pluggables는 코히어런트 트랜스폰더 기능을 라우터나 스위치 포트에 직접 통합하여, 별도의 독립형 DWDM 트랜스폰더 뱅크를 필요로 하지 않습니다. Cisco에 따르면 이는 사이트 간 광 계층(inter-site optical layer)에 필요한 추가적인 랙 공간, 전력 및 냉각을 줄여주는데, AI 공장 자체가 이미 전력 제약이 있는 상황에서는 중요한 고려 사항입니다.
지연 시간 문제 (The Latency Problem)
충분한 대역폭과 적절한 광학 장비가 있음에도 불구하고, 거리는 지연 시간을 추가합니다. 혼잡(congestion)이 발생하면 네트워크는 송신자에게 속도를 늦추라는 신호를 보내는 데 시간이 필요합니다. 로컬 AI 패브릭(local AI fabric) 내에서는 피드백이 빠르게 도착할 수 있습니다. 그러나 연결이 100킬로미터의 광섬어를 가로지른다면, 송신자가 문제가 있다는 것을 알기 전에 훨씬 더 많은 데이터가 전송될 수 있습니다.
Cisco는 100킬로미터를 아우르는 800 Gb/sec 연결에서, 해당 피드백 간격 동안 이미 약 100MB의 데이터가 전송 중일 수 있다고 계산합니다. Cisco는 이러한 더 긴 피드백 루프가 상당히 깊은 버퍼링(buffering)으로 설계된 네트워킹 실리콘의 가치를 높인다고 주장합니다. 매우 낮은 지연 시간을 위해 데이터센터 내부에서 설계된 얕은 버퍼 스위칭 아키텍처는 혼잡 피드백이 장거리 링크를 건너갈 때 트래픽을 흡수할 수 있는 용량이 적습니다.
Sivakolundu는
동일한 버퍼는 과다 할당(oversubscription) 문제 해결에도 도움을 줍니다. 만약 사이트 간 연결로 유입되는 결합 용량이 링크 자체의 용량을 초과한다면, 동기화된 버스트가 링크가 소진할 수 있는 속도보다 빠르게 도착할 수 있습니다. 버퍼링은 혼잡 제어(congestion controls)가 대응하는 동안 과도한 트래픽이 손실되지 않고 대기할 곳을 제공합니다.
사용 가능한 버퍼를 각 포트별로 고정된 양으로 나누는 대신, 공유 버퍼는 혼잡이 발생하는 모든 곳에 할당될 수 있는 패킷 메모리의 공용 풀입니다. 이를 통해 바쁜 링크가 패킷을 손실하지 않고 더 큰 버스트를 흡수할 수 있게 합니다.
Gold는 “도달 거리가 길어질수록, 더 많은 버퍼링이 필요할 수 있습니다”라며, “또한 필요한 곳에 가능한 한 많은 버퍼를 배치할 유연성이 필요합니다. 예를 들어, 문제가 있는 흐름으로 식별된 포트 하나 또는 몇 개에 말이죠. 저희의 접근 방식은 단일하고 완전히 공유되는 버퍼입니다.”라고 말했습니다.
AI 학습은 하나의 유용한 특징을 제공합니다. 즉, 그 집단 통신의 상당 부분이 반복적이며 따라서 DCI(Data Center Interconnect) 트래픽보다 더 예측 가능하다는 것입니다. Cisco의 접근 방식은 사전에 혼잡 관리(proactive congestion management)를 사용하여 예측 가능한 버스트가 문제를 일으키기 전에 트래픽을 유도하거나 스케줄링하는 동시에, 링크 장애와 같은 일시적인 혼잡 및 예측 불가능한 이벤트에 대비하여 깊은 버퍼링(deep buffering)을 안전망으로 유지하는 것입니다. 이 두 가지 접근 방식은 상호 보완적입니다. 하나는 큐잉 자체를 피하려고 하고, 다른 하나는 큐가 형성될 때 트래픽을 넣을 곳을 네트워크에 제공합니다.
Co-Design에 대한 Cisco의 베팅
Cisco의 스케일-어크로스(scale-across) 아키텍처는 Cisco 8223 및 Cisco N9000 플랫폼에 포함된, 51.2 Tb/sec 용량의 프로그래밍 가능한 깊은 버퍼 라우팅 프로세서인 Silicon One P200을 사용합니다. 이 시스템들은 장거리 링크를 위해 Cisco의 400G 및 800G 코히어런트 플러그어블 옵틱스(coherent pluggable optics)와 페어링될 수 있으며, 필요한 경우 Cisco Open Transport 3000 및 Cisco NCS 1014와 같은 개방형 라인 시스템이 광 전송 계층(optical transport layer)을 처리합니다.
Coherent pluggables는 라우팅 시스템에서 DWDM 파장을 직접 생성하고, 라인 시스템은 이 파장들을 광섬유(fiber plant) 전반에 걸쳐 증폭하고 전달합니다. 여러 개의 병렬 광섬유 쌍이 필요한 링크의 경우, Cisco의 Open Transport 3000은 여러 레일(rail)용 광학 부품을 하나의 라인 카드에 결합한 멀티-레일 설계를 사용합니다. Cisco는 이를 통해 레일당 전력을 75% 줄이고 랙 공간을 80% 절감할 수 있다고 주장합니다. 별도의 전송 시스템이 필요한 경우, NCS 1014는 1RU 라인 카드에서 12.8 Tb/sec의 용량을 제공할 수 있습니다.
P200은 프로그래밍 가능한 Run-to-Completion 네트워크 프로세서와 P4 툴링을 갖추고 있으며, Cisco에 따르면 이는 모든 프로토콜 지원, 원격 측정(telemetry), 기타 패킷 처리 기능이 새로운 실리콘 세대에 의존하여 변경하는 대신 소프트웨어로 개발될 수 있도록 합니다.
Sivakolundu는 규모 확장성(scale-across)의 경우, 운영자들이 여전히 다양한 토폴로지 및 트래픽 관리 방법을 테스트하고 있기 때문에, “동일한 프로그래밍 가능한 유연성이 모든 새로운 요구 사항이 칩 교체를 강요하지 않으면서 네트워크 기능을 발전시킬 수 있게 합니다”라고 말합니다.
Cisco는 또한 해당 설계에 사이트 간(inter-site) 트래픽을 위한 하드웨어 기반 보호 기능도 포함하고 있으며, 그 주장은 암호화가 학습 패브릭(training fabric)의 또 다른 처리 병목 현상을 만들어서는 안 된다는 것입니다.
Cisco 제안의 핵심 부분은 공동 설계(co-design)입니다. 네트워킹 ASIC은 완성된 라우터가 데이터센터에 도착하기 몇 년 전에 정의됩니다. Cisco는 자사의 실리콘, 시스템, 광학 팀이 같은 회사 내에 위치하기 때문에, 포트 밀도, 버퍼링, 전력, 원격 측정 및 광 인터페이스에 대한 요구 사항이 시스템 팀이 상용 ASIC을 받고 그 주변에서 무엇을 구축할지 알아내는 대신 칩 설계로 피드백될 수 있다고 주장합니다.
그렇다고 해서 규모 확장성(scale-across)이 단일 승인된 아키텍처로 정착되었다는 의미는 아닙니다. Cisco 자체도 문제를 캠퍼스, 메트로, 지역 배포로 나누고 있으며, 다양한 운영자들이 네트워킹 및 학습 기술의 여러 조합을 실험하고 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 The Next Platform의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기