
SLAI T-Rex: Ascend SuperPOD 상에서의 DeepSeek-V4 제품군에 대한 Full-Parameter
요약
Ascend NPU SuperPOD 환경에서 DeepSeek-V4 모델의 효율적인 사후 학습을 위한 최적화 프레임워크인 SLAI T-Rex를 제안합니다. 계층적 최적화를 통해 MFU를 34.22%까지 끌어올렸으며, 운영 연구(OR) 특화 데이터 파이프라인을 통해 높은 추론 성능을 달성했습니다.
핵심 포인트
- Ascend NPU 기반의 조 단위 파라미터 MoE 모델 최적화 프레임워크 개발
- 오픈 소스 대비 2.93배 향상된 34.22%의 모델 FLOPs 이용률(MFU) 달성
- 운영 연구(OR)를 위한 고품질 CPT 및 SFT 데이터 파이프라인 구축
- DeepSeek-V4-Flash 기반 OR 특화 모델의 높은 Zero-shot Pass@1 성능 입증
조 단위 파라미터 규모의 MoE (Mixture-of-Experts) 모델에 대한 Full-parameter post-training (전체 파라미터 사후 학습)은 심각한 메모리 압박, 중첩되지 않는 통신 오버헤드(non-overlapped communication overhead), 그리고 비효율적인 커널 실행을 포함하여 대규모 분산 학습에 있어 상당한 시스템 수준의 과제를 야기합니다. 대부분의 대규모 LLM 학습 시스템이 GPU 기반 클러스터를 중심으로 구축되는 반면, 본 보고서는 Ascend NPU SuperPOD에서의 엔드 투 엔드 (end-to-end) 최적화 사례를 제시합니다. DeepSeek-V4 모델 제품군을 대상 워크로드로 사용하여, 우리는 모델 수준의 병렬성 (model-level parallelism), 연산-통신 오케스트레이션 (computation-communication orchestration), 그리고 저수준 커널 실행 (low-level kernel execution)을 아우르는 계층적 최적화 프레임워크를 개발했습니다. 그 결과, 이 시스템은 학습 안정성을 유지하면서 오픈 소스 베이스라인 레시피 대비 2.93배 향상된 34.22%의 모델 FLOPs 이용률 (MFU)을 달성했습니다. 이 최적화된 인프라를 기반으로, 우리는 복잡한 OR (Operations Research, 운영 연구) 작업을 위한 CPT (Continual Pre-training, 지속적 사전 학습) 및 SFT (Supervised Fine-Tuning, 지도 미세 조정) 워크플로우를 추가로 구축했습니다. 우리는 이 통합 프레임워크를 SLAI T-Rex라고 부릅니다. DeepSeek-V4-Flash를 사용하여, 우리는 수집된 도메인 리소스와 솔버(solver)로 검증된 합성 최적화 문서(synthetic optimization documents)를 결합한 OR 지향적 CPT 및 SFT 데이터 파이프라인을 개발했습니다. 결과적으로 생성된 데이터셋은 4개의 작업 범주와 3개의 문제 표현 방식에 걸친 10K개의 고품질 SFT 샘플을 포함합니다. 이 특화된 모델은 평가된 모델 중 가장 높은 평균 zero-shot Pass@1 점수인 71.81%를 달성하였으며, 이는 GPT-5.4-Mini 및 기본 DeepSeek-V4-Flash 모델보다 각각 3.98%포인트와 11.27%포인트 높은 수치입니다. 전반적으로, 본 연구는 Ascend 인프라 상에서의 효율적인 조 단위 파라미터 모델 post-training부터 솔버에 기반한 수학적 모델링을 위한 도메인 특화 Flash 모델에 이르기까지의 풀스택 경로를 보여주며, 복잡한 추론을 위한 프런티어 모델 시스템을 발전시킵니다.
arXiv: https://arxiv.org/abs/2607.20145
Full Paper: https://arxiv.org/pdf/2607.20145
GitHub: https://github.com/SLAI-AITP/SLAI-T-Rex
Modelscope: https://www.modelscope.cn/models/SLAIAITP/DeepSeek-V4-Flash-OR (HuggingFace에서는 찾을 수 없었습니다) /u/pmttyji가 제출함 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기