Jev와 Kev 비교: 오픈소스 Jev 대안 테스트 결과
요약
본 글은 Kev 4B 모델과 Jev 모델을 비교 테스트한 결과를 공유합니다. 새로운 362개 항목의 출처 기반 데이터셋으로 평가했으며, Jev가 패러프레이즈 탐지(PAWS)에서 우위를 보였습니다. 다만, 짧은 요청 시 Jev는 추가 입력 토큰 사용량 때문에 비용이 더 많이 들 수 있다는 점을 지적합니다.
핵심 포인트
- Jev 모델은 PAWS 테스트에서 Kev보다 높은 정확도를 보임.
- 테스트 데이터셋은 새로운 362개 항목의 출처 기반 자료로 구성됨.
- Jev는 요청당 추가 입력 토큰 사용량이 많아 비용 효율성이 떨어질 수 있음.
저희는 Kev 4B(Jared Palmer가 Qwen3.5-4B를 Apache-2.0으로 파인튜닝한 모델)를 호스팅하고, 동일한 엔드포인트에서 Jev와 나란히 실행하여 비교해 보았습니다.
두 모델이 출시된 이후에 발행된 새로운 362개 항목(새로운 arXiv 논문, Stack Exchange 질문, GitHub 이슈 등)으로 구성된 신규 세트를 구축했으며, 답변은 출처를 기반으로 했습니다.
몇 가지 발견 사항:
- 정확도는 모든 작업에서 2점 이내로 나타나, 이 표본 크기에서는 노이즈 범위 내에 있습니다.
- Jev가 더 잘 보정되어 있으며, 패러프레이즈 탐지(PAWS)에서 우위를 점했습니다 (Jev 87.0% 대 74.5%).
- 리스트 가격은 동일하지만, Jev는 요청당 고정적으로 약 257개의 추가 입력 토큰을 사용합니다(TypeSafe를 직접 호출할 때와 같은 수치). 따라서 짧은 요청의 경우 최대 12배까지 비용이 더 많이 들 수 있습니다.
벤치마크 코드, 테스트 항목 및 결과는 GitHub에 있으니 원하시면 직접 실행해 보세요. 두 모델 모두 제 스타트업 Opper를 통해 라우팅되었습니다. 구체적인 내용은 기꺼이 논의하겠습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기