LongCat-2.0: Meituan이 Nvidia GPU 없이 1.6T 파라미터 코딩 모델을 학습시킨 방법
요약
Meituan이 출시한 1.6조 파라미터 규모의 MoE 모델 LongCat-2.0을 소개합니다. 이 모델은 Nvidia GPU 없이 중국 국산 ASIC만으로 학습되었으며, 100만 토큰 컨텍스트를 지원하는 새로운 희소 어텐션 메커니즘을 특징으로 합니다.
핵심 포인트
- 1.6T 파라미터 규모의 에이전트 기반 코딩 특화 MoE 모델
- Nvidia 하드웨어 없이 중국 국산 AI ASIC만으로 학습 성공
- LSA(LongCat Sparse Attention)를 통한 1M 토큰 컨텍스트 지원
- SWE-bench Pro 등 주요 벤치마크에서 프런티어 모델과 대등한 성능 기록
LongCat-2.0: Meituan이 Nvidia GPU 없이 1.6T 파라미터 코딩 모델을 학습시킨 방법
중국에서 음식 배달 및 슈퍼 앱 기업으로 가장 잘 알려진 Meituan은 2026년 가장 기술적으로 야심 찬 오픈 웨이트 (open-weight) 모델 출시 중 하나를 조용히 진행했습니다. LongCat-2.0은 에이전트 기반 코딩 (agentic coding) 작업을 위해 구축된 1.6조 파라미터 규모의 전문가 혼합 (Mixture-of-Experts, MoE) 모델로, 2026년 6월 30일에 MIT 라이선스로 출시되었으며 7월 5일 기준으로 Hugging Face에서 전체 가중치 (weights)를 사용할 수 있습니다. 이 모델을 살펴볼 가치가 있는 이유는 단순히 규모 때문만이 아니라, 두 가지 구체적인 엔지니어링 선택 때문입니다. 바로 백만 토큰 컨텍스트 (million-token contexts)를 위해 설계된 새로운 희소 어텐션 (sparse attention) 메커니즘과, Nvidia 하드웨어를 전혀 사용하지 않고 전적으로 중국 국산 AI ASIC에서 수행된 학습 과정입니다.
LongCat-2.0의 목적
LongCat-2.0은 범용 채팅 모델이 아닙니다. 이 모델은 저장소 수준의 코드 편집 (repository-level code edits), 다단계 도구 사용 (multi-step tool use), 그리고 장기적 에이전트 워크플로우 (long-horizon agent workflows)와 같은 자율 소프트웨어 엔지니어링을 위해 명시적으로 설계되었습니다. Meituan은 Claude Code 샌드박스와 Hermes 에이전트 하네스 (agent harness)를 통해 성능을 측정했으며, 벤치마크 결과는 이러한 목적을 반영합니다.
SWE-bench Pro에서 LongCat-2.0은 59.5점을 기록하며, 58.6점을 기록한 GPT-5.5를 근소하게 앞섰습니다. Terminal-Bench 2.1에서는 70.8점을 기록하여 Gemini 3.1 Pro (70.7)와 대등한 성능을 보였습니다. 코딩 벤치마크에서는 Claude Opus 4.8 (SWE-bench Pro에서 69.2, Terminal-Bench에서 78.9)에 뒤처지며, BrowseComp와 같은 더 넓은 범위의 일반 에이전트 작업에서는 뒤처집니다. 이 모델의 강점은 좁고 의도적입니다. 즉, API 비용의 극히 일부만으로 소프트웨어 엔지니어링 분야에서 폐쇄형 프런티어 (closed-source frontier) 모델들과 경쟁할 수 있습니다.
공식 발표 전, LongCat-2.0은 OpenRouter에서 "Owl Alpha"라는 이름으로 익명으로 운영되었습니다. 이 기간 동안 월간 약 10.1조 개의 토큰을 축적하며 전월 대비 242%의 성장률을 기록했고, Hermes Agent 리더보드 최상단에 올랐습니다. 개발자들은 누가 이 모델을 만들었는지 모르는 상태에서 이를 사용하고 있었습니다.
1M 토큰에서의 Sparse Attention 문제
100만(1M) 토큰의 컨텍스트 윈도우 (context window)를 효율적으로 실행하는 것은 진정으로 어려운 일입니다. 표준 어텐션 (Standard attention)은 시퀀스 길이의 제곱에 비례하여 확장되며, Sparse Attention (희소 어텐션) 메커니즘조차 이 정도 규모에서는 메모리 파편화 (memory fragmentation)와 예측 불가능한 대역폭 사용을 초래할 수 있습니다.
Meituan의 해답은 LongCat Sparse Attention (LSA)로, 이는 DeepSeek Sparse Attention을 세 가지 직교적인 개선 사항으로 확장한 것입니다:
**Streaming-aware Indexing (SI, 스트리밍 인식 인덱싱)**은 어텐션을 위해 토큰이 선택되는 방식을 재구성합니다. GPU 고대역폭 메모리 (HBM)로부터 파편화된 무작위 읽기를 수행하는 대신, SI는 토큰 선택을 하드웨어에 정렬된 순차적 메모리 읽기로 변환합니다. 그 결과 HBM 액세스가 병합 (coalesced)되어, 메모리 컨트롤러가 흩어진 주소를 쫓는 대신 예측 가능하게 프리페치 (prefetch)할 수 있게 됩니다.
**Cross-Layer Indexing (CLI, 교차 레이어 인덱싱)**은 트랜스포머 (transformer) 어텐션의 특성, 즉 어떤 토큰이 중요한지가 인접한 레이어들 사이에서 안정적인 경향이 있다는 점을 활용합니다. CLI는 한 번의 인덱싱 패스를 계산하고 추론 (inference) 중에 이를 여러 연속된 레이어에 걸쳐 재사용합니다. 이는 어떤 토큰에 어텐션을 기울일지 결정하는 비용을 분할 상환 (amortize)하며, 이러한 안정성 가정은 훈련 (training) 과정에서 교차 레이어 증류 (cross-layer distillation)를 통해 강화됩니다.
**Hierarchical Indexing (HI, 계층적 인덱싱)**은 2단계 스코어링 접근 방식을 적용합니다. 빠르고 근사적인 블록 수준 패스가 토큰 집합을 후보군으로 필터링하면, 그 다음 더 작은 집합에 대해서만 세밀한 토큰 선택을 실행합니다. 이를 통해 모든 토큰을 전체 정밀도로 스코어링하는 것을 방지합니다.
LSA는 또한 투기적 디코딩 (speculative decoding)을 위한 Multi-Token Prediction (MTP, 다중 토큰 예측)으로 확장되어, 추론 시 처리량 (throughput)을 더욱 향상시킬 수 있습니다.
LSA(Low-Rank Subspace Approximation)를 기반으로, 모델은 1,350억 개의 N-gram 임베딩 (N-gram Embedding) 파라미터(5-gram 토큰 조합 사용)를 추가합니다. 이는 MoE (Mixture of Experts) 전문가 수를 늘리지 않고도 임베딩 공간을 약 100배 확장하며, 파라미터 가중치를 전문가 라우팅 경로(expert routing path)에서 분리함으로써 대규모 배치 디코딩 (large-batch decoding) 중 메모리 I/O를 줄여줍니다.
50,000개의 중국산 ASIC을 이용한 학습
하드웨어 이야기는 가장 많은 관심을 끌고 있는 부분입니다. Meituan은 Nvidia GPU를 전혀 사용하지 않고, 보고된 바에 따르면 Huawei Ascend급 가속기인 50,000개 이상의 중국 국산 AI ASIC 클러스터에서 LongCat-2.0을 학습시켰습니다. 이 학습 과정은 35조 개 이상의 토큰을 다루었으며, 롤백(rollback)이나 복구 불가능한 손실 스파이크(loss spikes)가 발생하지 않았습니다.
이는 결코 사소한 일이 아닙니다. 비표준 하드웨어에서의 프런티어급 (Frontier-scale) 학습은 일반적으로 비결정론적 부동 소수점 연산 (non-deterministic floating-point operations), 결함 복구 격차 (fault recovery gaps), 그리고 Nvidia의 CUDA 스택에서는 잘 해결되어 있지만 다른 곳에서는 커스텀 엔지니어링이 필요한 메모리 병렬성 문제로 인한 불안정성에 직면합니다. Meituan은 임베딩, Flash Attention, LSA 및 MoE 레이어 전반에 걸친 결정론적 연산자 (deterministic operators), 하드웨어 스트레스 테스트 후 자동화된 링크 격리 및 재결합, 그리고 N-gram 임베딩 모듈을 위한 EMBP라 불리는 커스텀 접근 방식을 포함한 6D 병렬화 스킴 (6D parallelism scheme)을 통해 이 문제를 해결했습니다.
클러스터는 각 최대 48대의 머신으로 구성된 슈퍼포드 (superpods)로 조직되어 있으며, 각 포드 내부에서는 All-to-all 통신이 이루어지고 포드 사이에는 RoCE (RDMA over Converged Ethernet)가 사용됩니다. Meituan은 이러한 토폴로지 (topology)를 통해 사전 학습 (pretraining) 처리량 (throughput)이 약 30% 향상되었다고 보고했습니다.
여기서의 의의는 구조적입니다. 미국의 수출 통제는 중국 기업들의 Nvidia 최첨단 칩에 대한 접근을 제한해 왔습니다. 만약 1.6T 파라미터 모델이 대체 실리콘 (alternative silicon) 상에서 프런티어급 성능에 근접하게 학습될 수 있다면, 이는 GPU 하드웨어에 대한 수출 제한이 중국의 AI 발전 측면에서 당초 예상했던 것보다 장기적인 영향이 적을 수 있음을 시사합니다.
사후 학습 (Post-Training): 세 개의 전문가 클러스터
LongCat-2.0은 MOPD (Multi-Teacher Optimization via Mixture of Specialized Experts)라고 불리는 사후 학습 (Post-Training) 프레임워크를 사용합니다. MOPD는 단일 보상 모델 (Reward Model) 대신 세 개의 독립적인 전문가 클러스터 (Expert Clusters)를 학습시킵니다.
- 에이전트 전문가 (Agent Experts): 도구 호출 (Tool Invocation), 다회차 API 파라미터 파싱 (Multi-turn API Parameter Parsing), 그리고 자기 수정 실행 루프 (Self-correcting Execution Loops)를 처리합니다.
- 추론 전문가 (Reasoning Experts): 다단계 논리 (Multi-hop Logic), 수학, 그리고 STEM 문제 해결에 집중하며, 문제 난이도에 따라 적응형 연산 할당 (Adaptive Compute Allocation)을 수행합니다.
- 상호작용 전문가 (Interaction Experts): 지시 이행 (Instruction Following), 환각 억제 (Hallucination Suppression), 그리고 안전 제약 조건 (Safety Constraints)을 처리합니다.
동적 게이트 라우팅 (Dynamic Gate-routing) 메커니즘이 런타임 시 이들을 결합합니다. 이러한 분리는 안전 튜닝 (Safety Tuning)이 추론 성능을 저하시키거나, 추론 최적화가 모델로 하여금 지시 사항을 무시하게 만드는 흔한 실패 모드 (Failure Mode)를 방지하기 위함입니다.
액세스 및 라이선스 (Access and Licensing)
이 모델은 Hugging Face에서 MIT 라이선스 하에 사용할 수 있으며, BF16/F32 safetensors 및 FP8 변형 모델이 제공됩니다. GPU 추론은 SGLang을 통해 실행됩니다 (16x H20 권장). NPU 추론은 SGLang-FluentLLM을 통해 지원됩니다. 이 정도 규모의 셀프 호스팅 (Self-hosting)은 상당한 인프라(여러 개의 H20 노드)를 필요로 하므로, 노트북 수준의 실험이 아닙니다.
Meituan은 API를 통해 표준 종량제 가격(입력/출력 100만 토큰당 $0.75/$2.95)을 제공하며, 프로모션 요율로 $0.30/$1.20를 적용합니다. 주목할 만한 특징은 컨텍스트 캐시 히트 (Context Cache Hits)가 무료로 처리된다는 점인데, 이는 동일한 대규모 코드베이스를 반복적으로 참조하는 에이전트 워크플로우 (Agentic Workflows)의 경제성을 의미 있게 변화시킵니다.
이것이 입증하는 것 (What This Demonstrates)
LongCat-2.0은 벤치마크 수치를 넘어 두 가지 이유로 주목할 가치가 있습니다. 첫째, 백만 토큰(million-token) 컨텍스트를 위한 희소 주의 집중(sparse attention)이 해결 가능한 엔지니어링 문제임을 보여줍니다. LSA의 세 가지 구성 요소 접근 방식은 대규모 롱 컨텍스트 추론(long-context inference)을 어떻게 실용적으로 만들 수 있는지에 대한 구체적인 사례입니다. 둘째, 훈련 인프라 이야기는 비-Nvidia (non-Nvidia) AI 하드웨어의 현주소에 대한 하나의 데이터 포인트입니다. 50,000개의 ASIC을 사용하여 35조 토큰을 불안정성 없이 완료한 것은 하드웨어 격차가 좁혀지고 있다는 증거입니다.
개발자들에게 MIT 라이선스와 오픈 웨이트 (open weights)는 LongCat-2.0을 제한 없이 상용 제품에 통합할 수 있음을 의미합니다. 연구자들에게는 LSA와 MOPD에 대한 기술 보고서의 상세 내용이 매우 거대하고 매우 긴 컨텍스트를 가진 MoE (Mixture-of-Experts) 모델의 특정 병목 현상을 어떻게 엔지니어링으로 극복할 수 있는지에 대한 사례로서 읽어볼 가치가 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기