Unsloth, Swift1.5, Peculiar-Ragdoll, ThinkingCap 비교 및 Qwen3.8-27B 테스트 결과
요약
본 글은 Unsloth, Swift1.5, Peculiar-Ragdoll 등 여러 모델과 Qwen3.8-27B를 포함한 다양한 체크포인트를 비교 테스트하고 그 결과를 공유합니다. 69개의 평가 질문 세트로 성능을 측정했으며, 각 모델의 강점과 약점을 분석하여 사용자 맞춤형 도메인 중요성을 강조합니다.
핵심 포인트
- 다양한 모델(Unsloth, Swift1.5 등) 간의 성능 비교 테스트 결과를 공유함.
- Qwen3.8-27B를 포함한 여러 체크포인트의 평가 결과가 제시됨.
- tuieval 도구를 공개하여 사용자 맞춤형 도메인 질문 팩 제작을 권장함.
- 모델별 강점이 다르므로 사용자가 관심 있는 도메인을 정의하는 것이 중요함.
이전 게시물에서 Swift1.5와 peculiar-ragdoll의 체크포인트를 비교한 내용을 공유했습니다. 여기에 원래의 unsloth Q4_K_XL과 ThinkingCap Q4_K_M (L 또는 XL 버전은 제공되지 않음)을 추가하여 비교에 포함했습니다. 69개의 평가 질문 세트로 결과를 보여드립니다.
모든 테스트는 이제 동일한 '중간(medium)' 추론 노력으로 실행되었습니다.
unsloth-ud_q4_k_xl 하나는 llama.cpp를 사용하여 실행했으며, splash 포크 인퍼런스 엔진을 사용하지 않았습니다.
https://preview.redd.it/tztb66wygvsh1.png?width=2958&format=png&auto=webp&s=1c7132d631638e92f3dd90eac276d9ccfb2bf31e
느린 속도의 테스트에 대해 3회 반복하여 매번 69/69를 유지하는지 확인해 보겠습니다.
수정: u/jucabala457 님께서 mradermacher/Signal-3.8-27B-Terse-Coder-i1-GGUF 를 테스트해 달라고 요청하셨습니다. Q4_K_M이 사용할 수 있는 가장 근접한 양자화(quant)입니다. 정말 좋은 추가 요소가 될 것입니다! 이 GGUF는 텐서 비호환성 때문에 Splash 기반 엔진으로는 실행할 수 없었습니다. llama.cpp를 사용하여 느린 방식으로 실행했습니다. 이 이유로 총 소요 시간은 공정한 비교가 아닙니다. 아래에 업데이트된 결과를 공유합니다.
https://preview.redd.it/pvfvgd35twsh1.png?width=2976&format=png&auto=webp&s=a7f3ed846b8114a50bead053fb5536339b5e9d14
또한, tuieval 도구를 여기에 공개했습니다: https://github.com/ashe-wb/tuieval
제가 사용하고 테스트해 온 것이 완전히 로컬인 바이너리였기 때문에 이 도구가 여러분의 설치에서 바로 작동할지는 장담할 수 없습니다. 매일 다루는 특정 도메인의 평가 질문 팩으로 사용자 정의하세요. 이것이 가장 중요한 부분입니다. 어떤 모델이나 파인튜닝(fine-tune)이 한 가지에 좋지 않더라도 다른 것에는 매우 좋을 수 있으며, 여러분만이 자신의 도메인이 무엇에 관심 있는지 알고 있습니다. 모델이 게임 그래픽을 렌더링할 수 있는 능력은 저에게는 아무 의미가 없지만, 다른 누군가에게는 모든 것을 의미합니다.
https://preview.redd.it/m2n4rzlzjwsh1.png?width=2000&format=png&auto=webp&s=a209291261a01e9e1ef25c03af4f661fe0d61b21
제출자 /u/norenEnmotalen
[링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기