MoE 확장을 통한 Qwen3.6-35B-A3B의 코딩 성능 개선 결과
요약
본 글은 Qwen3.6-35B-A3B 모델에 'MoE 확장(MoE expansion)' 기법을 적용하여 코딩 성능 개선 결과를 분석합니다. 이 기법은 추론 시점에 라우터가 기본보다 많은 전문가를 활성화하며, HumanEval 테스트에서 pass@1 점수를 89.6%에서 90.9%로 소폭 향상시키는 효과를 보였습니다. 이러한 확장 기능을 AgrillaMoE라는 전용 서버에 통합하여 다양한 하드웨어와 API 호환성을 갖춘 개발 도구로 제공합니다.
핵심 포인트
- MoE 확장은 추론 시 라우터가 더 많은 전문가를 사용하게 합니다.
- HumanEval 테스트에서 pass@1 점수가 89.6%에서 90.9%로 소폭 개선되었습니다.
- AgrillaMoE 서버는 다양한 하드웨어(NVIDIA, AMD, Apple Silicon)와 API 호환성을 제공합니다.
저는 단일 RTX 2080 Ti 22GB에서 Qwen3.6-35B-A3B 모델을 4비트(UD-IQ4_XS)로 측정하여 HumanEval에서 pass@1 점수 89.6%를 기록했습니다. 이후 제가 테스트해 온 라우팅 기법인 'MoE 확장(MoE expansion)'의 통제된 A/B 테스트를 진행했습니다. 이 기법은 마지막 15개 레이어에서 토큰당 기존 8개 전문가 대신 20개 전문가를 활성화합니다. 그 결과, 디코딩 속도가 −19% 감소하는 대신 90.9% (+2 문제)의 성능을 달성했습니다. (MoE 확장이 작동합니다!)
설정 (두 테스트 모두 라우팅만 다름):
- Unsloth UD-IQ4_XS 동적 4비트(4.25 bpw) — 전체 모델이 VRAM에 적합하며, 오프로드 KV 캐시는 q8_0을 사용했습니다.
- 컨텍스트 길이: 16384
- OpenAI HumanEval에서 flash-attn 사용, 총 164개 문제, 원본 테스트(EvalPlus+ 아님), pass@1, 온도 0, 단일 샘플링 기준
- 사고 시간 제한(Thinking budget): 두 경우 모두 4096 토큰
- 코드 실행은 표준 검증(candidate) 테스트를 포함하는 샌드박스에서 진행되었으며, 타임아웃은 12초였습니다.
결과:
| 설정 | pass@1 (디코딩) |
|---|---|
| 기본 라우팅 (top-8) | 89.63% (147/164) |
| MoE 확장 (20개 전문가, 적응형, 레이어 25–39) | 90.85% (149/164) |
문제별 비교:
- 두 설정 모두 해결한 문제: 139개
- 확장만 해결한 문제: 10개
- 기본 라우팅만 해결한 문제: 8개
롤링 pass rate는 모든 체크포인트에서 확장 쪽이 +2~3문제 앞섰습니다.
MoE 확장이란 무엇인가요?
재학습이나 파일 변경 없이, 추론 시점에 라우터가 모델의 기본 top-K(여기서는 8개)보다 더 많은 전문가를 토큰당 사용합니다 (적응형 임계값 덕분에 쉬운 토큰은 적게 사용). 이는 레이어의 일부(40개의 25~39번째)에 적용됩니다. 즉, 토큰당 네트워크의 더 많은 부분을 참조하는 것입니다.
이전 벤치마크에서 Q8을 사용해 GPQA-Diamond에서 84.34% 대 81.82%를 기록했던 것과 같은 트릭이며, 이제 코딩에서도 4비트 환경에서 확인되었습니다.
솔직한 주의사항:
164개 문제 중 +2 문제는 통계적 노이즈(±3 pts CI) 범위 내에 있습니다.
이를 '동등하거나 약간 더 나은 품질'로 이해해야 하며, 입증된 성능 향상은 아닙니다. 이는 원래의 HumanEval 테스트이며, HumanEval+/EvalPlus가 아닙니다. 따라서 EvalPlus 리더보드의 pass@1 greedy n=1과 1:1로 비교해서는 안 됩니다. 또한 일부 리더보드에서 사용하는 20개 샘플 프로토콜도 아닙니다. 확장은 완전히 상주하는 모델의 디코딩 속도를 약 19% 증가시킵니다 (전문가(expert)가 많을수록 토큰당 FLOPs 증가). 이 도구는 제가 이것들을 AgrillaMoE라는 전용 llama.cpp 서버로 통합했습니다. 이 서버는 사용자의 VRAM을 감지하고 적절한 Unsloth 양자화 모델을 제안/다운로드하며, 기본적으로 확장 프로파일(재정의 가능)을 적용하고, OpenAI 및 Anthropic과 호환되는 API를 노출합니다 (Claude Code가 별도의 설정 없이 작동함). 그리고 GTX 10xx부터 RTX 50xx까지 NVIDIA, Vulkan을 통한 AMD, Metal을 통한 Apple Silicon에서 실행됩니다. Linux와 Windows용 정적 바이너리는 릴리스 페이지에 있습니다. 참고 자료: https://github.com/vagrillo/AgrillaMoE https://zenodo.org/records/22255483 제출자 /u/Specific-Tax-6700 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기