먼저 읽어주셔서 감사합니다
요약
작성자는 외부 기본 가중치 없이 처음부터(from scratch) 디코더 전용 MoE 모델인 Apex-2를 훈련한 결과를 공유합니다. 이 모델은 총 파라미터 3.87B에 16개 전문가를 사용하며, 86.5B 토큰으로 사전 훈련하고 코드/수학 중심의 SFT를 거쳤습니다. 벤치마크 결과 HumanEval+에서 Qwen2.5-1.5B와 유사한 성능을 보였으나, 지식과 수학 분야에서는 여전히 개선이 필요함을 확인했습니다.
핵심 포인트
- 외부 가중치 없이 처음부터 MoE 모델 훈련 성공
- Apex-2는 총 파라미터 3.87B, 활성 파라미터 1.45B 규모
- HumanEval+ 등 코딩 능력은 기존 대형 모델과 유사한 수준 달성
- 지식(MMLU) 및 수학적 추론 능력 향상을 위한 추가 연구 필요
먼저 읽어주셔서 감사합니다.
저는 작은 MoE 모델을 외부 기본 가중치 없이 완전히 처음부터(from scratch) 훈련했고, 그 결과와 몇 가지 배운 점을 공유하고자 합니다.
Apex-2
- 아키텍처: 디코더 전용 MoE (Decoder-only MoE), 모든 레이어가 MoE임 (밀집 레이어 없음)
- 크기: 총 파라미터 3.87B, 토큰당 활성 파라미터 1.45B
- 구성: 32개 레이어, d_model 2048, GQA 16Q/4KV, 16개 전문가(experts), top-4
- 컨텍스트: 4096
- 토크나이저: Qwen3 (151k)
- Hugging Face: https://huggingface.co/YOON1v/Apex-2
(transformers / vLLM을 통해 Qwen3MoeForCausalLM 매핑으로 로드 가능)
훈련 과정
- 사전 훈련 (Pretrain): 86.5B 토큰 (GH200 ×1 → DiLoCo를 사용하여 ×2)
- 지도 파인튜닝 (SFT): 약 2.5B 토큰 (코드 중심 + 수학 + 명령어)
- DPO: 시도했으나 점수가 떨어져서 체크포인트를 포기했습니다.
주요 수치 (SFT, greedy, chat template)
벤치마크
HumanEval: 43.9
HumanEval+: 41.5
MBPP: 56.3
MBPP+: 48.9
GSM8K (0-shot CoT): 32.4
MATH-500: 21.0
IFEval (프롬프트 엄격): 44.7
MMLU (5-shot): 28.6
흥미로운 비교
사전 훈련 토큰이 약 0.087T에 불과함에도 불구하고, 기본 모델의 HumanEval+ 점수는 Qwen2.5-1.5B (18T 사용)와 일치했습니다.
지식(MMLU)과 수학은 데이터 격차로 인해 여전히 많이 뒤처져 있습니다.
작동하지 않은 부분
DPO (220k 쌍, 길이 정규화)는 답변을 훨씬 길게 만들었고 코드/수학/IFEval에 악영향을 미쳤습니다.
그래서 중단하고 SFT 체크포인트를 유지했습니다. 전체 로그는 벤치마크 작성 글에 있습니다.
한계점 (솔직하게)
- 영어 중심적 (다국어 능력 거의 없음)
- 지식 부족 → 빈번한 환각(hallucinations)
- LiveCodeBench의 중간/어려움 난이도는 거의 0에 가까움
- 컨텍스트 4k만 지원
MoE 설정, DiLoCo 또는 DPO가 실패한 이유에 대해 질문하시면 기꺼이 답변드리겠습니다.
제출자: /u/Prestigious-Taste-63
[링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기