
MRC (Multipath Reliable Connection)을 활용하여 대규모 AI 훈련 네트워크 구축
요약
본 기사는 대규모 AI 모델 학습에 필수적인 고신뢰성 슈퍼컴퓨터 네트워크 기술인 MRC(Multipath Reliable Connection)를 소개합니다. OpenAI는 이 새로운 프로토콜을 Open Compute Project(OCP)를 통해 공개하며, 이를 통해 GPU 네트워킹 성능과 복원력을 획기적으로 개선할 수 있다고 설명합니다. MRC는 다중 평면 고속 네트워크 설계, 적응형 패킷 분사(adaptive packet spraying), 정적 소스 라우팅 등을 활용하여 네트워크 혼잡 및 장애로 인한 학습 지연을 최소화하고 AI 시스템의 확장성을 높이는 데 기여합니다.
핵심 포인트
- MRC(Multipath Reliable Connection)는 대규모 AI 모델 학습 클러스터에서 GPU 네트워킹 성능과 복원력을 향상시키기 위해 개발된 새로운 프로토콜입니다.
- 이 프로토콜은 다중 평면 고속 네트워크를 구축하여 네트워크 장애에 대한 이중화(redundancy)를 제공하며, 적응형 패킷 분사 기능을 통해 핵심 혼잡을 사실상 제거합니다.
- MRC는 정적 소스 라우팅(static source routing)을 사용하여 경로 실패를 우회하고 전체 클래스의 라우팅 오류를 제거함으로써 학습 중단 위험을 최소화합니다.
- OpenAI가 이 사양을 OCP에 공개한 것은 AI 시스템의 핵심 인프라 계층에서 표준을 공유하여 전반적인 확장성과 신뢰성을 높이려는 전략적 움직임입니다.
최첨단 모델(Frontier model) 훈련은 GPU 간에 데이터를 빠르게 이동시킬 수 있는 안정적인 슈퍼컴퓨터 네트워크에 의존합니다. 이를 더 빠르고 효율적으로 만들기 위해 OpenAI는 AMD, Broadcom, Intel, Microsoft, NVIDIA와 협력하여 MRC (Multipath Reliable Connection)를 개발했습니다. 이는 대규모 훈련 클러스터에서 GPU 네트워킹 성능과 복원력을 향상시키는 새로운 프로토콜입니다. 저희는 오늘 Open Compute Project (OCP)를 통해 MRC를 출시하여 더 광범위한 산업이 이를 사용할 수 있도록 했습니다.
매주 9억 명 이상의 사람들이 ChatGPT를 사용하면서, 저희 시스템은 AI의 핵심 인프라가 되고 있으며 전 세계 사람들과 기업들이 점점 더 강력해지는 모델로 구축할 수 있도록 돕고 있습니다. __Stargate__의 시작 이전에, 저희는 몇 년에 걸쳐 파트너들과 긴밀하게 협력하며 첫 세대의 슈퍼컴퓨터를 개발하고 가동시키고 유지 관리하는 과정을 거쳤습니다. 이러한 귀중한 경험은 Stargate 규모에서 컴퓨팅을 효율적으로 사용하고 임무를 성공시키기 위해서는 네트워크 설계를 포함하여 스택(stack)의 모든 계층에서 복잡성을 재고하고 대폭 줄여야 한다는 강력한 믿음을 심어주었습니다.
MRC 사양을 공개하는 것은 OpenAI의 전반적인 컴퓨팅 전략의 일부입니다. 핵심 인프라 계층에서 공유 표준은 AI 시스템이 더 효율적이고, 안정적으로, 그리고 더 광범위한 파트너 생태계에 걸쳐 확장되는 데 도움을 줄 수 있습니다. 본 게시물에서는 다음 내용을 다룰 것입니다: i) 어떻게 MRC가 적은 구성 요소와 전력으로 네트워크 장애를 극복하기 위한 다중 평면(multi-plane) 고속 네트워크 구축을 가능하게 하는지, ii) MRC의 적응형 패킷 스프레이(adaptive packet spraying)가 코어 혼잡(core congestion)을 사실상 제거하는 방법, iii) 저희 배포가 정적 소스 라우팅(static source routing)을 사용하여 장애를 우회하고 라우팅 실패의 전체 클래스를 제거하는 방법을 다룹니다. 이러한 이점들이 결합되어 모두에게 더 나은 모델을 더 빠르게 제공할 수 있게 합니다.
대규모 AI 모델을 훈련할 때, 단일 단계는 수백만 건의 데이터 전송을 포함할 수 있습니다. 지연되는 하나의 전송은 전체 작업에 파급 효과를 일으켜 GPU가 유휴 상태로 머무르게 할 수 있습니다. 네트워크 혼잡(Network congestion), 링크 및 장치 장애(link, and device failures)는 전송에서 지연과 지터(jitter)의 가장 일반적인 원인입니다.
이러한 문제들은 클러스터 크기가 증가함에 따라 더욱 빈번해지고 해결하기 어려워집니다. 이로 인해 네트워킹 기술은 Stargate 설계의 핵심 부분이 되었습니다.
Stargate 슈퍼컴퓨터의 현재 규모를 가능하게 하기 위해, 저희는 두 가지 주요 네트워크 과제에 직면했습니다. 첫째, 가능한 한 네트워크...
AI 자동 생성 콘텐츠
본 콘텐츠는 OpenAI Blog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기