200개 태스크 커스텀 데이터셋 성능 결과: 2B MoE부터 27B Dense까지 인기 모델 10종 비교
요약
본 글은 200개의 커스텀 태스크 데이터셋을 사용하여 다양한 크기의 인기 LLM 10종의 성능을 비교한 결과를 공유합니다. Gemma-4-26B가 최고 성능(S 티어)을 보였으며, Qwen3.8-27B와 qwen3.5-9b도 높은 평가를 받았습니다. 또한, 모델 크기 대비 효율성까지 고려하여 테스트에 임했음을 언급했습니다.
핵심 포인트
- Gemma-4-26B가 200개 태스크에서 최고 성능(S 티어)을 기록함.
- Qwen3.8-27B와 qwen3.5-9b도 높은 성능으로 A 티어를 차지함.
- 모델 크기 대비 효율성(무게)과 성능 모두를 고려하여 평가가 진행됨.
- 테스트는 실제 사용자가 수행하는 커스텀 도구 호출 등 실용적인 태스크에 초점을 맞춤.
결과는 스크린샷에 있지만, 여기 TL;DR 티어리스트를 공유합니다:
S 티어 - Gemma-4-26B는 심지어 iq3s로 양자화(quantized)되었을 때도 제 차트에서 최고 성능을 보여줍니다.
A 티어 - Qwen3.8-27B-q3/q5 모델은 정말 저를 놀라게 했습니다. Dense 모델임에도 불구하고 느리게 작동했지만, S 티어 자리를 차지하지는 못했습니다. 왠지 qwen3.5-9b도 이 슬롯에 속합니다.
B 티어 - Qwen3.5-4b와 Gemma-4-e2b 역시 믿을 수 없을 정도로 좋은 성능을 보여주었습니다. 후자는 자신의 크기보다 훨씬 뛰어난 성능을 발휘했습니다.
C 티어 - Gemma-4-12B, Nanbeige는 둘 다 성능에 비해 너무 무겁습니다. 패스입니다.
F 티어 - Ling-3.0-tiny, minicpm
테스트 질문들은 제가 어시스턴트와 매일 하는 태스크들로 구성되었으며, Fable 4.1이 작성했습니다. 제가 작업하는 llm 클러스터는 'Hive'이며, 이 클러스터에는 모델들이 다양한 기능을 위해 호출하는 커스텀 도구(custom tools)와 실행 파일(executables)이 포함되어 있습니다. 이러한 기능들을 호출하거나 잘못 호출하는 것이 중요하며, 필요 이상으로 무거운 모델을 구동하는 것은 손해였기 때문에, 여기서는 두 가지 장점을 모두 얻으려고 노력했습니다.
어쨌든 저는 이것이 흥미롭다고 생각했습니다. 여러분도 그렇게 느끼기를 바랍니다! YMMV (Your Mileage May Vary).
/u/Potential-Net-9375 제출
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기