ASIC부터 플릿까지: 하이퍼스케일러 NIC 구축 및 운영 경험
요약
본 글은 Meta가 수십만 대의 프로덕션 호스트에 커스텀 멀티-호스트 NIC인 fbnic을 배포하고 운영하기 위해 구축한 인프라를 설명합니다. 기존 벤더 NIC의 격리 실패 문제를 해결하고자 물리적 격리를 도입했지만, 이를 위한 운영 부담이 과도했습니다. 이에 하드웨어-인-더-루프 CI 파이프라인과 통합 관측 가능성 시스템 등을 통해 안정성을 극대화한 경험을 공유합니다.
핵심 포인트
- 물리적 격리로 NIC의 연쇄 실패 문제를 해결함.
- 하드웨어-인-더-루프(HIL) CI 파이프라인 구축.
- 통합 관측 가능성으로 교차 계층 오류를 추적.
- 범위 지정 복구 자동화로 장애 영향 범위를 최소화.
- 가용성을 12배 감소시키고 MTTR을 37% 단축함.
우리는 Meta의 수십만 대 프로덕션 호스트에 커스텀 멀티-호스트 NIC인 fbnic을 배포하고 운영하기 위해 구축한 운영 인프라를 설명합니다. 레트로피팅된 싱글-호스트 아키텍처로 설계된 벤더 멀티-호스트 NIC는 공유 펌웨어와 버퍼로 인해 7년 동안 연쇄적인 격리 실패를 겪었습니다. fbnic은 물리적 격리를 통해 이러한 문제를 제거했지만, 자체 하드웨어로 전환하는 것은 전체 운영 부담을 하이퍼스케일러에게 전가시킵니다. 우리는 펌웨어, 드라이버, 커널 교차 제품을 테스트하는 하드웨어-인-더-루프(hardware-in-the-loop) CI 파이프라인; NIC와 스위치 카운터를 공존시켜 교차 계층 오류 귀속(cross-layer fault attribution)을 위한 통합 관측 가능성(observability) 파이프라인; 10개 미만의 펌웨어 메시지 유형을 가진 드라이버 우선 아키텍처(driver-first architecture); 슬레드(sled) 단위의 세분화된 목표 펌웨어 업그레이드 오케스트레이터; 그리고 폭발 반경(blast radius)을 개별 호스트 슬라이스에 국한시키는 범위 지정 복구 자동화(scoped repair automation)를 제시합니다. 10개월이 넘는 기간 동안, fbnic은 동일 플랫폼의 벤더 NIC 대비 계획되지 않은 가용성(unplanned unavailability)을 12배 감소시키고, 평균 수리 시간(mean time to repair)을 37% 낮추었으며, 하드웨어 교체 횟수를 2.3배 줄이는 성과를 거두었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기