교훈을 얻었습니다. 레포지토리를 무작정 신뢰하지 말고 장기간(수 주) 벤치마크를 위해 모든 것이 안정적인지 확인해야 합니다.
요약
로컬 모델과 양자화(quantization)를 비교한 벤치마킹 과정에서, 평가 워크플로우의 안정성 문제를 발견하고 수정했습니다. Flash Next와 xhigh/medium 추론 노력 설정이 여전히 우수하며, 3.8 27B 모델도 특정 조건에서 유효함을 재확인했습니다.
핵심 포인트
- 벤치마킹 시 레포지토리를 무작정 신뢰하기보다 장기간 안정성 검증이 필수적입니다.
- Flash Next가 여전히 최고 성능을 보이지만, xhigh/medium 추론 노력의 이점이 명확합니다.
- 3.8 27B 모델도 특정 작업에서 유효하며, 일상적인 사용에서는 medium 설정을 선호할 수 있습니다.
이전에 제가 swe-verified django 100 태스크 벤치마킹으로 다양한 로컬 모델과 양자화(quantization)를 비교한 것을 게시했습니다.
지금은 새로운 모델은 없지만, 제가 사용하던 과정에서 불행하게도 안정적이지 않았던 평가 워크플로우에 대한 수정 사항이 있습니다. 모든 실행에 대해 재평가를 했고, 눈에 띄는 몇 가지 변화가 있습니다:
Flash Next가 여전히 최고이지만, xhigh와 medium 추론 노력(reasoning effort)의 이점이 이제 제대로 나타납니다.
3.8 27B도 마찬가지입니다 (다만 일상적인 작업에서는 개인적으로 여전히 medium을 사용하는 것을 선호합니다).
제출자: /u/WonderRico [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기