어떤 모델과 어떤 하니스가 좋을까요? 제가 데이터를 가지고 있습니다.
요약
본 글은 다양한 하니스(harness)와 모델 구성을 테스트하여 실제 작업 능력과 속도를 측정하고 비교한 연구 결과입니다. 로컬 환경에서도 독점 모델에 필적하는 성능을 보여주며, 특히 opencode 및 omp 같은 특정 하니스가 높은 신뢰성과 안정적인 점수를 제공함을 강조합니다.
핵심 포인트
- 로컬 하드웨어에서 하니스(harness)의 중요성이 매우 높습니다.
- opencode와 omp는 모델에 관계없이 85% 이상의 높은 신뢰성을 보장하는 최적의 하니스로 추천됩니다.
- 신뢰성 중시 시: swift-1.5-qwen3.8-27b-q6_k + opencode/omp 조합을 권장합니다.
- 속도 중시 시: qwen3.8-flash-next-strata를 활용하는 것이 유리합니다.
저는 실제 작업(기본 수학, 비전, 컴퓨터 사용(이메일 읽기, 상점 길 찾기) 및 코딩)에 대해 다양한 하니스와 모델 구성을 지속적으로 테스트하고 있습니다. 저는 벤치마크와 리더보드를 만들었습니다. 여기에서 확인할 수 있습니다: https://airbench.ai/leaderboard?k=poL
이것은 능력(다양한 작업에서의 성공률 %)과 속도를 측정합니다.
참고로, Claude Code Opus 5.5는 100% (14분 26초)를 기록했습니다.
zcode/4xRTX6k/glm-5.3-flash-NVFP4를 사용하면 같은 점수를 로컬에서 달성하는 것이 가능합니다: 100% (31분 13초). 품질은 같지만, 약간 더 느립니다.
만약 아주 작은 오류를 감수한다면 속도를 높일 수 있습니다:
- DSHv0.2rc2/RTXPRO6000WS/qwen3.8-flash-next-NVFP4: 98% (23분 30초)
- qwen3.8-flash-next-iq3_xxs-strata가 속도 면에서 최고입니다: opencode에서 96% (7분 41초)를, omp에서 94% (11분 31초)를 기록했습니다. Claude Code보다 빠릅니다!!!!
다른 발견 사항:
- 로컬 하드웨어에서는 모델만큼이나 하니스가 중요합니다. 동일한 strata 양자화(quant)를 사용하더라도 같은 5090에서 하니스에 따라 점수가 22%에서 96%까지 달라집니다.
- 이제 로컬 환경에서도 독점 모델과 대등하게 경쟁할 수 있습니다. 두 가지 예시:
- 최고의 모델 (단일 RTX 5090)
- swift-1.5-qwen3.8-27b-q6_k가 가장 견고합니다. pi / omp / opencode에서 각각 96% / 94% / 92%를 기록했으며, 5가지 하니스를 평균하여 82%로, 테스트된 모든 모델 중 최고입니다.
- qwen3.8-flash-next-iq3_xxs-strata가 속도 면에서 최고입니다: opencode에서 7분 41초에 96%를, omp에서 11분 31초에 94%를 기록했습니다.
- qwen3.8-27b-nvfp4는 96%에 도달할 수 있지만, 1시간 40분에서 1시간 50분이 걸리며 하니스에 크게 의존합니다(37% ~ 96%).
- 성능을 저해하는 요소: MTP 변형 모델은 매번 점수가 떨어집니다 (nvfp4-mtp는 MTP가 없을 때 평균 70% 대비 52%를 기록). 또한, 65k 컨텍스트도 성능에 영향을 미칩니다(45–61%). Gemma-4-26b는 빠르지만 최대 47%에서 정체됩니다.
- 최적의 하니스 (Best harness)
공정한 비교를 위해, 저는 다섯 가지 하니스가 모두 동일한 5090(swift q6_k, flash-next-strata, 27b-nvfp4)에서 실행된 세 가지 모델을 사용했습니다:
opencode: 평균 94% (92 / 96 / 94)
omp: 91% (94 / 94 / 86)
pi: 71% (96 / 80 / 37)
hermes: 67% (82 / 22 / 96)
openclaw: 56% (45 / 53 / 69)
opencode와 omp만이 어떤 모델을 사용하든 항상 85% 이상을 유지하는 하니스입니다.
pi는 일부 모델에서는 매우 좋지만, 다른 모델에서는 신뢰성이 떨어집니다.
hermes는 높은 점수를 받을 수 있지만 느립니다. 로컬 실행의 대부분이 1시간 20분 이상 걸리며, 몇몇은 2시간 제한에 도달하므로, 그 점수는 부분적으로 너무 늦게 도착한 답변들로 구성되어 있습니다.
클라우드 실행에서도 같은 패턴을 보입니다. deepseek-v4.1-flash의 경우, omp, pi, opencode 모두 98%를 기록했지만, hermes는 82%에 그쳤습니다.
만약 오늘 5090이 하나 있다면: 신뢰성을 원한다면 swift-1.5-qwen3.8-27b-q6_k와 함께 opencode 또는 omp를 사용하고, 속도를 원한다면 qwen3.8-flash-next-strata와 함께 사용하는 것이 좋습니다.
이처럼 더 상세한 분석을 읽고 싶다면 기여할 수도 있습니다!
https://airbench.ai/
제 웹사이트는 누구나 자신의 환경을 벤치마크하고 리더보드에 기여할 수 있도록 합니다.
로컬 에이전트를 테스트하는 것은 매우 쉽습니다. 웹사이트가 생성해 주는 프롬프트를 복사하기만 하면 됩니다.
저의 바람은 우리가 더 많은 다양한 하드웨어에서 훨씬 더 많은 구성을 테스트할 수 있다는 것입니다.
(1) 웹사이트는 로그인이 필요합니다. 죄송하지만, 이는 허위 제출을 방지하는 데 도움이 됩니다.
(2) 웹사이트가 구성에 대한 충분한 세부 정보를 요청하지 않으므로, 설정 내용을 노트 필드에 상세하게 문서화해 주시기 바랍니다.
어떻게 생각하시는지 알려주세요.
제출자: /u/dh7net
[링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기