단일 사이트의 한계를 넘어서: WhiteFiber의 111.2 Tbps 데이터 센터 간 AI 아키텍처 심층 분석
요약
단일 데이터 센터의 물리적 한계를 극복하기 위해 83km 거리의 여러 사이트를 연결하는 111.2 Tbps 대역폭의 '스케일 어크로스(scale-across)' AI 네트워킹 아키텍처를 분석합니다. WhiteFiber, DriveNets, WEKA의 협업을 통해 밀리초 미만의 지연 시간으로 분산된 GPU 클러스터를 하나의 논리적 패브릭으로 통합하는 기술적 메커니즘을 다룹니다.
핵심 포인트
- 단일 사이트의 전력 및 공간 제약을 해결하는 스케일 어크로스 아키텍처 제시
- 83km 구간에서 111.2 Tbps 대역폭과 밀리초 미만의 저지연 성능 구현
- 광 전송, 분산형 네트워크 패브릭, 분산형 데이터 플랫폼의 3계층 통합 구조
- 지리적으로 분리된 GPU 리소스를 하나의 논리적 패브릭으로 연결하여 MFU 최적화
WhiteFiber, DriveNets, 그리고 WEKA의 스케일-어크로스 (scale-across) AI 네트워킹 아키텍처에 대한 심층 기술 분석으로, 83km에 걸쳐 111.2 Tbps의 대역폭과 밀리초 미만의 지연 시간(latency)을 제공합니다.
🤖 단일 사이트 AI 학습의 물리적 한계
딥러닝 (deep learning) 모델이 수조 개의 파라미터(parameters) 규모로 확장됨에 따라, AI 인프라 팀은 단일 사이트 데이터 센터 용량이라는 물리적 한계에 직면하고 있습니다. 전력 가용성, 냉각 제한, 그리고 물리적 공간의 제약으로 인해 운영자가 단일 시설 내에서 GPU 클러스터를 확장하는 데 어려움을 겪는 경우가 빈번합니다. 더 확장하기 위해서는 조직이 단일 건물 내의 전통적인 "스케일 업 (scale-up)" 또는 "스케일 아웃 (scale-out)" 설계에서 벗어나, 여러 물리적 데이터 센터에 걸쳐 있는 "스케일 어크로스 (scale-across)" 아키텍처로 전환해야 합니다.
WhiteFiber, DriveNets, 그리고 WEKA는 이러한 가정을 뒤엎는 장거리 설계를 검증했습니다. 이들의 시스템은 83km 범위에 걸쳐 GPU 리소스를 연결하며, 111.2 Tbps의 총 대역폭(aggregate bandwidth)과 밀리초 미만의 지연 시간(sub-millisecond latency)을 제공합니다. 그 결과, 하나의 더 큰 시설을 기다리는 대신 기존 사이트 전반에 걸쳐 AI 용량을 확장할 수 있는 실질적인 레퍼런스 아키텍처 (reference architecture)를 제시합니다.
🤖 스케일 어크로스 AI 클러스터링의 메커니즘
멀티 사이트 GPU 클러스터링의 주요 장벽은 분산 학습 (distributed training)의 동기화 단계입니다. 집합 통신 (collective communication) 작업(예: All-Reduce) 중에 GPU는 그래디언트 업데이트 (gradient updates)를 교환해야 합니다. 만약 데이터 센터 간의 네트워크 링크에서 상당한 지연 시간 (latency)이나 패킷 드롭 (packet drops)이 발생하면, GPU는 유휴 상태가 되어 모델 플롭스 활용도 (Model Flops Utilization, MFU)가 낮아지게 됩니다.
WhiteFiber 아키텍처는 지리적으로 분리된 데이터 센터를 하나의 논리적 패브릭 (logical fabric)으로 취급함으로써 이 문제를 해결합니다. 이는 세 가지 통합된 레이어를 통해 달성됩니다:
- 광 전송 레이어 (Optical Transport Layer) (WhiteFiber): 중간 재생 (regeneration) 없이 83km 구간에서 111.2 Tbps의 처리량 (throughput)을 유지하기 위해 고급 광 트랜시버 (optical transceivers)로 작동하는 대용량, 저지연 다크 파이버 (dark fiber) 링크.
- 분산형 네트워크 패브릭 (Disaggregated Network Fabric) (DriveNets): 제어 평면 (control plane)과 독립적으로 패킷 포워딩 (packet forwarding)을 확장할 수 있는 분산형 분리 샤시 (DDC, Distributed Disaggregated Chassis) 라우팅 시스템으로, 장거리 링크 전반의 트래픽 라우팅을 최적화함.
- 분산형 데이터 플랫폼 (Distributed Data Platform) (WEKA): 양쪽 사이트 전체에 걸쳐 글로벌 네임스페이스 (global namespace)를 제공하는 소프트웨어 정의 스토리지 (software-defined storage) 레이어로, 저지연 데이터 액세스를 보장하고 국지적인 스토리지 병목 현상을 제거함.
83킬로미터 구간의 지연 시간 및 혼잡 관리
83km 거리에서는 실리카 파이버 (silica fiber) 내 빛의 물리적 전파 지연 (propagation delay)으로 인해 약 0.41밀리초 (ms)의 편도 지연 시간이 발생합니다 (km당 약 5마이크로초 가정 시). RoCEv2 (RDMA over Converged Ethernet)에 요구되는 왕복 시간 (RTT, Round-Trip Time)을 1밀리초 미만 임계값 아래로 유지하기 위해서는 추가적인 프로토콜 및 큐잉 오버헤드 (queuing overhead)를 최소화하는 것이 매우 중요합니다.
이 거리에서 왕복 전파 지연은 약 0.82ms이며, 이는 모든 400 Gbps 포트에서 약 41MB의 데이터가 전송 중 (in flight)임을 의미합니다. 이는 동기화된 RoCEv2 버스트 (burst) 발생 시 얕은 공유 버퍼 (shallow shared buffers)를 압도하기에 충분한 양입니다. DriveNets 패브릭은 딥 버퍼 스위칭 (deep-buffer switching), 우선순위 흐름 제어 (Priority Flow Control), ECN 기반 혼잡 신호 전달 (ECN-based congestion signaling), 그리고 광 경로 전반의 동적 부하 분산 (dynamic load balancing)을 통해 이러한 위험을 해결합니다. 이러한 제어 기능이 중요한 이유는 아주 작은 손실률 (loss rate)이라도 수천 개의 GPU에 걸쳐 재전송을 유발하여, 빠른 WAN을 비용이 많이 드는 학습 병목 현상으로 바꿀 수 있기 때문입니다.
| 파라미터 (Parameter) | 단일 사이트 기준선 (Single-Site Baseline) | WhiteFiber 확장 아키텍처 (WhiteFiber Scale-Across Architecture) |
|---|---|---|
| 물리적 거리 (Physical Distance) | < 100 미터 | 최대 83 킬로미터 |
| ... |
스토리지 동기화 및 데이터 일관성
분산된 GPU 클러스터 (Distributed GPU cluster)의 속도는 스토리지 경로 (Storage path)의 속도에 의해 결정됩니다. WEKA의 글로벌 네임스페이스 (Global namespace)를 사용하면 어느 사이트에서든 동일한 학습 데이터를 읽을 수 있으며, 로컬 캐싱 (Local caching)을 통해 반복되는 읽기 작업을 GPU 근처에서 유지할 수 있습니다. 운영자는 링크 성능 저하 (Link degradation) 상황에서의 메타데이터 지연 시간 (Metadata latency), 장애 복구 (Failure recovery), 그리고 일관성 (Consistency)을 반드시 테스트해야 합니다.
🎯 실무적 시사점 (Practical Takeaway)
진정한 결과는 단순히 헤드라인에 나오는 대역폭 (Bandwidth)만이 아닙니다. 그것은 광 용량 (Optical capacity), 결정론적 혼잡 제어 (Deterministic congestion control), 그리고 공유 데이터 평면 (Shared data plane)의 결합입니다. 원격 GPU를 하나의 풀 (Pool)로 취급하기 전에, 팀은 집합적 지연 시간 (Collective latency), 버퍼 점유율 (Buffer occupancy), 스토리지 페일오버 (Storage failover), 그리고 완료된 학습 실행당 비용 (Cost per completed training run)을 벤치마킹해야 합니다.
단일 캠퍼스의 전력, 냉각 또는 부동산 문제로 제약을 받는 조직에게 이 설계는 신뢰할 수 있는 스케일아웃 (Scale-out) 경로를 제공합니다. 이는 지연 시간 (Latency), 회복 탄력성 (Resilience), 그리고 운영 규율 (Operational discipline)을 측정 가능한 상태로 유지하면서 별도의 시설들을 조율합니다.
출처 (Sources)
- WhiteFiber Announces Cross-Data-Center AI Infrastructure Innovation Delivering 111.2 Tbps Bandwidth with Sub-Millisecond Latency Across 83km — Web source, July 9, 2026
- DriveNets Announces Industry's First Commercial Deployment of a Long-Distance, Scale-Across AI Supercluster - PR Newswire — Web source, July 9, 2026
🔗 원문 게시지: ixuvo.com
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기