Qwen3.8-27B 파인튜닝 및 베이스라인 비교 vs. 최첨단 모델
요약
본 글은 Qwen3.8-27B 파인튜닝 모델을 포함한 여러 최첨단 LLM들을 광범위하게 평가하고 비교한 결과를 공유합니다. 저자는 특히 로컬 환경에서 높은 정확도와 적은 리소스를 보여준 mradermacher/Signal-3.8-27B-Terse-Coder를 주목하며, 하드웨어 성능과 모델의 효율성이 중요함을 강조했습니다.
핵심 포인트
- 로컬 모델(mradermacher/Signal-3.8-27B)이 높은 정확도와 낮은 리소스로 우수함.
- 최첨단 모델 대비 평가 시간이 매우 길어 저사양 하드웨어에 불리함.
- 모델의 성능은 사용 사례, 도메인, 그리고 하드웨어 사양에 따라 달라짐.
- OpenRouter 등 플랫폼에서 양자화 정보를 의무 공개할 필요가 있음.
요약: 제 사용 사례에서는 mradermacher/Signal-3.8-27B-Terse-Coder.i1-Q4_K_M이 효과적임이 입증되었습니다. 사용자마다 다를 수 있지만, 도메인별 테스트에 따라 달라질 것입니다. 문제를 해결하는 데 걸리는 시간은 최첨단 모델과 비교했을 때 엄청나게 길며, 특히 저처럼 저사양 하드웨어(potato)를 사용하는 경우 더욱 그렇습니다. 현재 제가 사용할 수 있는 모델의 전체 평가 세트 KPI는 28배 느립니다. 이 시간 차이는 더 좋은 하드웨어를 가진 사람들에게는 훨씬 관대할 수 있습니다.
약 일주일 전에 Qwen3.8-27B 파인튜닝을 비교한 예비 테스트를 공유했습니다. 이후 저는 이러한 파인튜닝 모델들을 대상으로 469개 도메인에 걸친 다일간의 포괄적인 평가를 수행했습니다. 일관성을 위해 모든 모델을 llama.cpp와 동일한 사고(thinking) 설정으로 실행했습니다. 또한 Opus 5.5 및 Astra 전체 평가 세트, 그리고 OpenRouter를 통해 Qwen3.8-Flash-Next에 대한 부분 평가도 진행했습니다. 일부 제공업체는 양자화(quantization) 정보를 공개하지만 다른 곳은 그렇지 않습니다. OpenRouter가 이를 의무화하면 좋을 것 같습니다.
제가 PTA 지수라고 부르는 것이 있습니다. 이 수치는 모델, 평가 세트, 사용 가능한 하드웨어에 따라 달라질 것입니다. 하지만 진행 상황을 측정하는 근거(grounding) KPI의 일부가 될 수 있습니다. [IMG:N]
Astra는 토큰 사용량이 가장 적었지만, 제공업체가 추론 과정을 가리는 것 같습니다. 어떤 모델도 100% 정확도를 달성하지 못했습니다. Opus 5.5가 근접했으며 99.6%로 최고 기록을 차지했습니다. 제가 가진 로컬 모델 중에서는 mradermacher/Signal-3.8-27B-Terse-Coder.i1-Q4_K_M이 더 높은 정확도를 달성하면서도 작업 완료에 필요한 토큰 사용량과 시간이 적었습니다. Q4_K_M 파인튜닝이 다른 L 또는 XL 모델보다 성능이 좋다는 것은 좋은 발견입니다. 한 번만 잘라내어(overthought to cut off only once) 다른 모델들보다 더 많은 테스트를 통과했습니다.
Signal-Terse-Coder가 AgentionAI의 Signal-3.8-27B와 Shockem의 Terse-Coder LoRA 조합이라는 것을 어딘가에서 읽었습니다. 저는 여기서 메커니즘을 이해하지 못하지만, 내부적으로 어떤 종류의 마법이 일어나고 있는 것 같습니다. OpenRouter의 모델들의 TTFT(Time To First Token)에 대해서는 너무 많이 생각하지 않는 것이 좋겠습니다. 그들은 캐싱을 하며, 제가 영향을 줄 수 있는 부분이 거의 없습니다.
중앙값 토큰과 더 흥미로운 정보는 아래에 있습니다. 각 모델이 과도하게 생각한 질문의 수는 'Cut off' 열에 표시되어 있습니다 (제 설정은 질문당 최대 16,384 토큰): Signal-Terse-Coder가 1개 위반했고, Dirk가 4개, Unsloth가 4개를 위반했습니다. https://preview.redd.it/iucw41rzc5uh1.png?width=2984&format=png&auto=webp&s=742905e5344c85f78abd14c2028f729e86c42995 19분 대 9시간은 놀랍습니다. 반론하자면, 프런티어 모델에 대한 사생활 보호가 0인 것이 로컬 환경의 약 100과 비교했을 때만큼이나 놀라운 일입니다. 더 나은 하드웨어가 정상화제 역할을 합니다. 저는 Astra가 추론 과정을 숨기면서 469개의 질문 중 456개에 대해 가장 적은 토큰을 얻는 것처럼 보인다고 의심합니다. Opus 5.5와 Astra가 답변한 같은 질문은 Astra의 추론 과정이 제공업체에 의해 가려진 것일 수 있음을 보여줍니다. 그럼에도 불구하고, Astra의 응답은 간결하며 코드 주석 없이 요청된 내용에 대해 유효하게 통과했습니다. Opus 5.5 https://preview.redd.it/87cicfq1f5uh1.png?width=2846&format=png&auto=webp&s=1f3687c1ed9349a74c873e51b62c46699917783d Astra https://preview.redd.it/aztvm4nkf5uh1.png?width=2858&format=png&auto=webp&s=ec8612c8cded25fa96990eb832159ad0acd192fb 목록에는 없지만 gpt-oss-120b는 제 pandas/numpy 작업에서 엄청나게 잘 작동했습니다. 오직 도메인별 평가만이 그러한 사례를 밝혀내고 특정 작업을 위해 어떤 모델/파인튜닝을 피해야 하는지 경고해 줄 수 있습니다. 저는 또한 AgentionAI/Qwen3.8-27B-AP-Q4_K_XL과 UkisAI/Swift-1.5-Qwen3.8-27B-Q4_K_L도 시도했지만, 둘 다 약 115개 질문에서 실행을 중단했습니다. 그때 이미 명확한 패턴이 형성되었고, 완료까지 진행할 필요성을 느끼지 못했습니다. https://preview.redd.it/zhiqa0bqt5uh1.png?width=2990&format=png&auto=webp&s=062fb0fb37cedbf58c1a966b8086aa6360f04850 처음에 저는 이 도구를 저 자신을 위해 만들었습니다. 하지만 이후 엔진을 테스트/데이터와 분리하여 다른 사용자의 선택에도 확장 가능하도록 만들었습니다. 여기에서 이용할 수 있습니다 https://github.com/ashe-wb/tuieval /u/norenEnmotalen 님이 제출했습니다 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기