
EschaLabs/Qwen3.6-35B-A3B-Escha-W2 모델 성능 분석
요약
EschaLabs의 Qwen3.6-35B-A3B-Escha-W2 모델에 대한 벤치마크 분석 결과입니다. 낮은 양자화(W2)를 사용했음에도 불구하고 높은 추론 속도와 뛰어난 성능을 유지하며, 특히 VRAM 효율성이 매우 높음을 확인했습니다.
핵심 포인트
- W2 양자화 모델임에도 불구하고 높은 생성 및 프리필 속도 기록
- GPQA-Diamond 등 주요 벤치마크에서 고비트 모델과 대등하거나 우수한 성능
- 낮은 VRAM 점유율로 인해 제한된 하드웨어 환경에서 활용 가능성 증대
- 수학적 추론 및 코드 생성 능력에서 높은 정확도 유지
안녕하세요 여러분. 저는 낮은 양자화(low quants)가 믿기 힘든 수치를 내놓는 것에 지쳤습니다. 저 역시 상당히 회의적이었고, 제가 시도해 본 바로는 그 주장들이 부족하다는 인상을 자주 받았습니다. 그래서 이번에 Twitter에서 이 모델을 발견했습니다. 사용해 보니 기대 이상으로 성능이 좋아서 놀랐습니다. 직접 검증하기 위해 antigravity의 도움을 받아 몇 가지 벤치마크를 실행해 보았습니다. 결과는 다음과 같습니다:
| Axis / Metric | Escha (W2 ROCmFPX) | APEX (Q5 Balanced) | Key Finding / Winner |
|---|---|---|---|
| VRAM Memory Allocated | 12.19 GiB (100% VRAM) | 15.20 GiB VRAM Zero CPU Offload System RAM Allocated | 0.00 GiB |
| Generation Speed (tg128) | 84.72 tokens/sec | 45.72 tokens/sec | Escha가 1.85배 빠름 |
| Prefill Speed (pp1024) | 2,684.55 tokens/sec | 1,081.24 tokens/sec | Escha가 2.48배 빠름 |
| 32-Chunk Perplexity (wikitext-2) | 7.1635 ± 0.10 PPL | 5.8659 ± 0.08 PPL | APEX가 약 22% 낮은 손실률을 보임 |
| IFEval (Instruction Adherence) | 10 / 10 (100.0%) | 10 / 10 (100.0%) | 무승부 (100% 규칙 준수) |
| GSM8K (Verified Math Reasoning) | 20 / 20 (100.0%) | 20 / 20 (100.0%) | 무승부 (100% 수학 정확도) |
| HumanEval+ Code Unit Tests | 5 / 5 (100.0%) | 5 / 5 (100.0%) | 무승부 (100% 수학 정확도) |
| LiveBench Coding (2025 Uncontaminated) | 5 / 5 Clean Python | 5 / 5 Clean Python | 무승부 (유효한 코드 생성) |
| GPQA-Diamond (10 PhD Questions) | 10 / 10 (100.0%) | 9 / 10 (90.0%) | Escha가 승리함 |
저는 llama.cpp 설정을 업데이트(-n 16384)하고, 확장된 생성 예산(최대 토큰 8,192에서 12,000으로)을 사용하여 토큰 제한에 걸리는 질문들을 다시 실행했습니다. APEX (5-bit Q5): 더 긴 검증 루프(예: 문자 단위 DNA 정렬 배열, 휴지기 물리 가정 재확인 등)에서 지연되는 경향이 있습니다. 이로 인해 APEX는 10개 질문 중 4개에서
비록 이것이 매우 작은 표본 크기이며 전혀 결정적이지는 않지만, 적어도 모델이 이러한 벤치마크에서 성능 저하를 보이지 않는다는 것을 보여줍니다. 이 점을 참고하십시오. 물론 더 많은 스트레스 테스트가 필요합니다. 또한 저는 제 하네스(harness)와 에이전트 스킬(agent skills)을 사용하여 도구 호출(tool calling)에 대한 자체적인 느낌 기반 확인(vibe based check)을 수행하여 준수 여부를 확인했습니다. 모두 통과했으며 결과에 만족했습니다. 아, 그리고 저는 AMD 카드를 가지고 있어서 이 [https://huggingface.co/cafonez/Escha-W2-35B-A3B-ROCmFP2]를 통해 실행해 보았습니다. 그들의 트위터는 [https://x.com/Eschalabs]이며, 그곳에서도 독립적으로 검증된 결과들을 공유하는 것 같습니다. 명확히 하자면 저 역시 회의적이지만, 결과들은 유지되는 것처럼 보입니다. 이것은 VRAM이 부족한 우리에게 큰 도움이 될 수 있습니다. /u/WigglyScrotum 제출 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기