LongCat-2 학습에 사용된 "AI 가속기(AI Accelerators)"에 대해 알려진 것들
요약
LongCat-2 모델 학습에 사용된 중국산 AI ASIC 가속기의 기술적 특징을 분석합니다. Nvidia GPU 없이도 1.6조 파라미터 규모의 모델을 안정적으로 학습할 수 있음을 보여주며, 슈퍼포드 구조와 메모리 최적화 기법을 활용한 설계 방식을 다룹니다.
핵심 포인트
- Nvidia를 대체하는 중국산 AI ASIC 기반의 프런티어 규모 학습 성공
- 슈퍼포드(Superpod)와 RoCE 패브릭을 활용한 2계층 네트워크 설계
- HBM 용량 한계를 극계하기 위한 ZeRO-1 및 메모리 오프로딩 기법 적용
- 큰 L2 캐시와 프리페칭을 통한 메모리 지연 시간 극복
- 코어별 프로그래밍 가능성을 통한 MoE 모델의 병렬 실행 최적화
이 모델은 BF16 기준으로 3.55 TB에 달하며, 정말 엄청난 규모입니다. 이는 상당한 수준의 하드웨어가 필요함을 시사하므로, 저는 릴리스 포스트(https://longcat.chat/blog/longcat-2.0/)를 읽어보았습니다. 제가 얻은 결론은 "프런티어(frontier) 규모에서 신뢰할 수 있는 비-Nvidia(non-Nvidia) 공급망이 이제 존재한다"는 것이었습니다. 저는 그 비결(secret sauce)에 대한 더 많은 정보가 있기를 바랐지만, 포스트에서는 칩 제조사나 모델 번호를 전혀 언급하지 않았습니다. 대신 일관되게 "AI ASIC" / "가속기(accelerator)" / "우리의 가속기(our accelerators)"라는 일반적인 용어를 사용합니다. 하지만 해당 페이지의 자체 메타 설명(중국어)에는 "1.6万亿总参大模型,训练全程由国产芯片完成"라고 되어 있으며, 이는 "1.6조 파라미터 모델, 전체 학습 과정이 국산 [중국] 칩으로 완료됨"으로 번역됩니다. 따라서 우리가 이미 추측했듯이, 이는 Nvidia가 아닌 중국산 AI 가속기이며, 이는 포스트 전체가 본질적으로 프런티어 규모의 모델을 Nvidia GPU 없이도 학습할 수 있음을 보여주는 시연이라는 의미입니다. 이로 인해 여기서 "ASIC"이 무엇을 의미하는지 궁금해졌습니다. 행렬 곱셈(matmul)을 위해 하드웨어적으로 고정된 특정 용도(LLM 학습용?) 집적 회로(Application-Specific Integrated Circuit)를 말하는 것일까요? 그들은 이에 대해 어느 정도 답을 주었지만, 저는 행간을 읽게 되었습니다. 총 수백만 가속기-일(accelerator-days) 동안 35조 개 이상의 학습 토큰을 처리하면서, 롤백(rollback)이나 복구 불가능한 손실 급증(loss spikes)이 전혀 없었다는 점은 ASIC으로서 매우 신뢰할 만합니다. 사전 학습(pre-training)에 50,000개 이상의 ASIC이 사용되었으며, 서빙/학습을 위해 "수만 개"가 소위 "슈퍼포드(superpods)"로 그룹화되었습니다. "슈퍼포드(Superpod)"는 최대 48개의 칩이 올투올(all-to-all) 고대역폭 인터커넥트(Nvidia의 NVLink 도메인과 유사한 방식?)로 연결된 것을 의미하며, 이 또한 상당하다고 생각합니다. 그런 다음 슈퍼포드들은 RoCE 패브릭(RoCE fabric, RDMA over Converged Ethernet — 컴퓨팅 클러스터를 연결하기 위한 표준 고속 네트워킹 프로토콜)을 통해 서로 연결됩니다. 꽤 기본적인 방식이지만 꽤 멋집니다. 이러한 2계층(two-tier) 설계는 "빠른" 통신 도메인을 한 번에 수백 개의 칩으로 확장하여, 약 30%의 추가 학습 처리량(throughput)을 제공하는데, 이는 엄청난 수치입니다. 이 ASIC들은 주요 병목 현상인 Nvidia H800(80GB)보다 칩당 HBM(고대역폭 메모리) 용량이 적습니다. 이로 인해 ZeRO-1 샤딩(sharding), 선택적 재계산(selective recomputation), 사용되지 않는 활성화 함수 오프로딩(offloading unused activations) 등 다양한 메모리 트릭을 집중적으로 사용해야 했습니다.
HBM 대역폭(bandwidth) 대비 큰 L2 캐시(L2 cache)를 보유하고 있으며, 이들은 메모리 지연 시간(memory latency)을 숨기기 위해 모델 가중치(model weights)를 캐시로 프리페칭(prefetching)하여 이를 활용합니다. 아마도 이 부분에서 성능 이득이 발생하는 것으로 보입니다. 코어별 프로그래밍 가능성(Per-core programmability)을 통해, 모델의 "밀집(dense)" 부분과 "MoE 전문가(MoE expert)" 부분을 단순히 중첩시키는 것이 아니라 서로 다른 코어에서 완전히 병렬로 실행할 수 있게 합니다. 칩 자체에 내장된 200 Gbps 네트워크 인터페이스는 추론(inference) 과정 중 "프리필(prefill)" 서버와 "디코드(decode)" 서버 간에 KV-캐시(KV-cache) 데이터를 전달하는 데 사용됩니다. 마지막으로 그들은 커스텀 결정론적 연산자(custom deterministic operators)를 구축하고, 수치적 축약 수학(numerical reduction math, 부동 소수점 오차를 제한하기 위한 이진 트리 누적 방식)을 재설계했으며, 연산 집약적 연산자(compute-heavy operators)에 비트 플립 탐지(bit-flip detection)를 추가했다고 언급합니다. 이는 그들이 아직 하드웨어 자체의 오류 수정(error correction) 기능을 완전히 신뢰하지 않아, 손상된 비트를 직접 확인하고 있음을 시사합니다. 또한, 네트워크 링크에 문제가 생겨도 훈련이 중단되지 않고 격리될 수 있도록 하는 표준적인 자동 결함 탐지/페일오버(automatic fault detection/failover) 기능도 포함되어 있습니다. 저는 이것이 정말로 주요 헤드라인들을 비껴갔다고 느낍니다. 이것은 단순한 칩 사양서가 아닙니다. LongCat/Meituan이 커스텀 소프트웨어 엔지니어링(병렬화 전략, 커널, 수치 연산, 결함 허용(fault tolerance))을 통해, Nvidia보다 메모리가 적고 소프트웨어 스택이 미성숙한 칩을 보완함으로써 1.6T 파라미터 규모의 GPT급 모델을 전적으로 Nvidia가 아닌 국산 실리콘(domestically-made silicon)만으로 학습하고 서비스할 수 있음을 공개적으로 증명한 것입니다. 따라서 다시 한번 강조하자면, 핵심 요점은 "이제 프런티어 규모에서 신뢰할 수 있는 비-Nvidia(non-Nvidia) 공급망이 존재한다"는 것입니다.
submitted by /u/ThePrimeClock [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기