JevK5 v0.3 실기 검증 | Jev Decision Index 및 JevBench 평가와 모든 판단 모델 비교 마스터 표
요약
본 기사는 'Jev'라는 타입 지정 판단(Typed Decision) 아키텍처의 현황을 다루며, 오픈소스 커뮤니티에서 이를 재현하고 평가하는 주요 벤치마크 사이트 두 곳을 소개합니다. 특히 최신 모델인 JevK5 v0.3 (4B)를 중심으로 로컬 환경에서의 실기 검증 결과를 상세히 분석했습니다.
핵심 포인트
- Jev는 문장 생성 없이 '타입이 지정된 판단'을 내리는 초저지연 아키텍처입니다.
- 주요 평가 벤치마크로는 Jev Decision Index와 Benchmark Heaven/JevBench가 있습니다.
- JevK5 v0.3 (4B)의 성능과 다른 4B 모델과의 비교 분석이 이루어졌습니다.
- 평가 과정은 '공통 하네스 & 감사 포함 PR 제출형' 오픈 벤치마크 방식을 따릅니다.
1. 서론: Jev 재현의 현황과 평가 커뮤니티
2026년 9월 중순에 TypeSafe AI가 발표한 'Jev'는 문장 생성을 하지 않고 직접 '타입이 지정된 판단(Typed Decision)'을 내리는 초저지연 아키텍처(System 1)로서 큰 충격을 주었습니다.
이에 따라 오픈소스 커뮤니티에서는 'Jev를 로컬에서 재현하고 확장하는' 시도가 폭발적으로 가속화되고 있습니다. 현재 이러한 오픈 결정 모델의 실력을 측정하고 비교하기 위한 주요 국제 벤치마크 사이트로 다음 두 곳이 주목받고 있습니다:
- Jev Decision Index (multimodalart의 Hugging Face Spaces)
- Benchmark Heaven / JevBench (benchmarkheaven.com, Florian Standhartinger)
본고에서는 이러한 해외 리더보드에서 최신 모델인 'JevK5 v0.3 (4B)' 의 위치를 객관적으로 정밀하게 분석하고, 필자의 로컬 실기 환경(RTX 3090 24GB)에서 총 5개 단계에 걸친 철저한 벤치마크 실시 기록을 전달합니다.
2. 세계의 평가 사이트와 JevK5의 위치
JevK5의 실력을 보기 전에, 커뮤니티에서 참조되는 두 개의 주요 평가 기반 아키텍처 및 객관성의 실제 상태, 그리고 JevK5의 순위와 다른 4B 모델과의 비교 위치를 정리합니다.
① Jev Decision Index (Hugging Face Spaces)
- URL: huggingface.co/spaces/multimodalart/jev-decision-index
- 리포지토리:
apolinario/decision-index
(Apolinário Passos / multimodalart 작성) -
개요: 13만 건 이상의 동결(Frozen) 요청을 기반으로 하는 결정 모델의 종합 트래커입니다. Decoding(제약적 병렬 디코드), Diffusion(텍스트 확산), Trained(증류/커스텀 헤드 학습 모델) 등의 카테고리별로 레이더 차트와 단일 스코어로 추적됩니다.
테스트 스위트 및 채점 사양
- 132,422 건의 동결 요청 (Frozen Suite):
Jev 본가에서 평가된 총 132,422건의 요청(판단 문제)이 sha256 해시로 엄격하게 고정되어 있습니다. - 엄격한 탈락 페널티:
unanswered = wrong
모델이 처리할 수 없었던 요청, 답변을 거부한 사례, 추론 오류가 발생한 문제는 모두 일률적으로 0점으로 처리됩니다. 어려운 문제를 건너뛰어 점수를 부풀리는 치트키는 전혀 통하지 않습니다. - 우연 보정 (Chance-corrected):
전체 태스크에서 무작위 추측에 의한 기대값을 제외한 보정 스코어(0이 찍기, 100이 완전 정답)를 산출하여 각 영역을 동일 가중 평균합니다.
【중요】 '자기 신고'인가 '독립 객관 평가'인가? 평가 아키텍처의 실제 상태
커뮤니티에서 'Index 스코어'를 참조할 때, 이 플랫폼이 '어떻게 실행되고 있는지' 를 올바르게 이해해야 합니다.
LMSYS Chatbot Arena처럼 '관리자가 모든 모델의 가중치를 맡고, 자체 클러스터에서 완전히 차단하여 추론을 실행하는 중앙집권형' 방식이 아닙니다. 실제는 다음 '공통 하네스 & 감사 포함 PR 제출형 (오픈 벤치마크 방식)' 입니다:
- 실행 주체: 각 모델 개발자나 커뮤니티 기여자가 공개 리포지토리의 공식 하네스(
run.py/report_model.py)를 사용하여, 자신의 로컬 GPU 또는 Hugging Face Job 상에서 실행합니다. - 제출 및 감사: 실행 결과 로그와 스코어를 GitHub의 Pull Request(PR)로 제출합니다.
- 병합 기준: 관리자 측(multimodalart 등)이 제출된 답변 거부(
answer_gaps.py)에 대한 감사를 하거나 해시 일치를 검증한 후에 병합하고, 정적 사이트(index.html/index.json)를 빌드합니다.
⚠️ [IMG:N] 형식 토큰은 이미지 placeholder 입니다. 번역하지 말고 원래 위치에 그대로 유지하세요.
| 평가 유형 | 실행 주체 | 테스트 세트 | 객관성/신뢰성 | 해당 사례 |
|---|---|---|---|---|
| 완전 자가 보고 (Self-reported Proxy) | 모델 개발자 | 자체 보유 (held-out split 등 비공개) | 낮음~중간 (과적합 또는 체리피킹의 여지 있음) | 모델 카드 README에 '정확도 ○%'만 기재하는 경우 |
| 공통 하네스/감사 기반 PR형 | 개발자 / 자원자 (PR) | 완전히 동일함・sha256 고정 (13.2만 문항) | 높음 (데이터 및 채점 규칙은 공통이나 추론은 각자 실행) | - |
| Jev Decision Index | 완전 독립・중앙 실행형 | 벤치마크 주최자 | 최고 (가중치만 전달받아 주최자가 완전히 차단된 상태에서 추론) | LMSYS Arena, 각종 비공개 대회 |
모델 카드에 기재된 'Index Proxy 0.731'과의 결정적인 차이점
JevK5의 공식 카드 등에 기재된 점수(예: v0.3의 0.731)는 이 13만 건의 실전 스위트를 돌린 값이 아니며, 공식 테스트 세트 유출을 피하기 위해 학습 데이터의 held-out 행(16개 벤치마크 × 각 40행 = 약 640건)을 사용하여 개발자 스스로 산출한 '자가 추정값 (Proxy)' 입니다.
공식 Index를 완주했던 이전 버전 JevK5 0.2.2
(v0.2 가중치)는 점수 36.31을 기록하며, 전체 49개 시스템 중 15위, 교정 정확도 (Calibration)에서는 4위에 랭크되었습니다. v0.3은 현재 공식 큐에서 측정 대기 중입니다.
Decision Index에 게재된 다른 4B 모델과의 비교 및 위치
Jev Decision Index에는 Qwen3.5-4B 등 오픈 웨이트를 기반으로 하는 여러 4B 클래스 결정 모델(또는 디코딩 기술)이 등록되어 있습니다:
- NeoHorse-Jev-4B:
Qwen/Qwen3.5-4B-Base에서 파인튜닝된 4B 결정 모델. - Kev-4B: Qwen 기반의 선형 Attention / LoRA 어댑터형 결정 모델.
- ImaJev-4B: 텍스트 및 비즈니스 판정에 특화된 멀티모달 대응 4B 파생 모델.
- JevK5 0.2.2: 전체 49개 시스템 중 종합 15위.
【Index에서 JevK5의 주목할 만한 강점: 교정 정확도 (Calibration) 세계 4위】
많은 4B 모델은 점수를 경쟁하느라 과신(Overconfidence: 95% 이상의 높은 확률로 오답하는 현상)을 일으키기 쉽습니다. 하지만 JevK5는 13만 건에 달하는 전체 테스트 세트를 거친 교정 정확도 (Calibration) 면에서, 전체 49개 시스템 중 '세계 4위' 에 위치하고 있습니다. 이는 4B 클래스 내에서는 단연코 최고이며, '자신이 정답인지 아닌지에 대한 자신감(확률)의 신뢰성이 가장 높은 4B 모델'로 국제적으로 평가받고 있습니다.
또한, 최신 v0.3은 이중 장기 숙성 증류(double long-context distillation)를 통해 held-out proxy에서 0.731로 지능 밀도를 대폭 끌어올렸으며, 공식 Index 큐 소화에 따라 4B 최고 클래스로 도약하는 것이 확실시되고 있습니다.
② Benchmark Heaven / JevBench
- URL: benchmarkheaven.com/jev-models
- 리포지토리:
fstandhartinger/jevbench
(Florian Standhartinger 작성)
- 개요: Jev 특화 독립 벤치마크 기반. '상태(State)와 선택지 규정(Rubric)을 입력하고, 유형화된 답변과 각 선택지의 확률 분포를 반환'하는 Jev-class 결정 모델 전용으로 설계되었습니다 (자연어 대화 프롬프트나 문장 구문 분석은 일절 포함하지 않음).
4대 평가 축 및 엄격한 복합 점수 계산식
종합 점수(JevBench Score)는 지능・교정도・속도・비용의 4 요소를 등가중 조화 평균 (Equal-weight Harmonic Mean) 하여 산출됩니다:
- 지능 (Intelligence - 25%):
각 난이도 티어(Hard 30%, Standard 28%, Judge 28%, Easy 14%)의 우발 보정 정답률 (accuracy - chance) / (1 - chance)
지능 점수가 50 미만으로 저조할 경우, 종합 점수에 (Intelligence / 50)²의 강력한 페널티가 부과됩니다. -
보정도 (Calibration - 25%):
최난이도 티어(Hard tier)에서의 ECE(Expected Calibration Error) 및 정답 분포에 대한 통계적 충실도. 확률을 제시하지 못하고 라벨만 반환하는 모델은 0점 처리됩니다. -
속도 (Speed - 25%):
p50과 p95 지연 시간의 로그 스코어 평균. 을 기준으로 하며, 10배 느려질 때마다 0.1초 = 100점 (실제 운영 부하를 모사하기 위해 -20점 보정 적용).
$ ext{시간} imes 2 + 0.15 ext{초} -
비용 (Cost - 25%):
토큰 단가가 아닌 '1,000 Decisions(결정 횟수)당 달러 단가'. $$0.001 = 100점$을 기준으로 10배 비싸질 때마다 .-
30점
봉인 테스트 세트 (Sealed Decisions)를 통한 과적합 및 치팅 방지
JevBench가 국제적으로 가장 신뢰받는 이유는 '비공개 비밀 테스트 세트(Sealed Decisions)' 를 포함하고 있기 때문입니다:
- 최신 v1.5.5에서는 평가 규모가 대폭 확대되어, 시스템당
**1,624건의 결정 요청(이 중 720건은 미공개/봉인 세트)**이 부과됩니다 (Claude Opus 5와 GPT-5.6 Sol이 작성하고 상호 검토). - 과적합 페널티: 공개 세트와 봉인 세트 간 정답률 격차가 25% 이상 벌어질 경우, 과적합/부정행위로 간주되어 Intelligence 점수가 대폭 감점됩니다.
JevBench에서의 JevK5 순위 및 진화 궤적
-
JevBench v1.4 시리즈 (초기 534 문항): JevK5 v0.2는 전체 76개 시스템 중 '종합 2위'이자 '오픈 모델 중 단독 1위'(종합 점수 62.04)를 획득했습니다. - 이후, JevK5 v0.2를 기반으로 추가 LoRA를 적용한 파생 모델
Plumb-4B(65.84점)와Imajev-4B(67.37점)이 등장하며 상위권을 다투었습니다. -
JevK5 v0.2는 전체 76개 시스템 중 '종합 2위'이자 '오픈 모델 중 단독 1위'(종합 점수-
최신 JevBench v1.5.5 · headline (1,624 문항・전체 109 시스템 확정 랭크): - 결정 문제 수가 3배로 늘어난 1,624문항(봉인 720문항)으로 확장된 최신 공식 메인보드(headline view)에서 정식으로 JevK5 v0.3가 측정 및 랭크되었습니다. - 이 최신 보드의 결과는 다음과 같습니다:
7위: JevK5 v0.3****10위: Imajev-4B
-
공개 검증 세트에서의 최난이도 티어(Hard tier) 정답률 0.784, 난이도 ECE 0.054라는 압도적인 내성이 720건의 봉인 테스트 세트에서도 여지없이 발휘되어, JevK5 v0.3는 Imajev-4B를 직접 역전하여 4B 최상위 클래스(7위)로 재등극했습니다.
-
결정 문제 수가 3배로 늘어난 1,624문항(봉인 720문항)으로 확장된 최신 공식 메인보드(headline view)에서 정식으로
JevBench에 게재된 다른 4B 모델과의 비교 및 위치
JevBench는 그야말로 '4B 결정 모델의 치열한 정상 결전장' 입니다. 109개 시스템이 경쟁하는 가운데, 상위권을 형성하는 4B 모델들의 관계성은 다음과 같습니다:
- JevK5 v0.3 (v1.5.5 headline 7위):
최신 1,624문항(봉인 720문항) 테스트를 완주하며, 4B 오픈 모델로서 최상위 그룹에 위치. - Plumb-4B (crh225 제작):
실제로는 'JevK5 v0.2.0'을 기반 모델로 채택하고, 여기에 LoRA를 추가 학습시킨 파생 모델입니다.
- Imajev-4B (v1.5.5 헤드라인 10위):
v1.4 시리즈에서 일시적으로 선두를 달렸으나, 1,624 문제의 대규모 폐쇄 테스트(v1.5.5)에서 JevK5 v0.3에게 역전당했습니다.
- decider-4b v2 (Mapika 작):
속도와 비용 효율성에 특화하여 조정된 4B 결정 모델입니다.
- reflex 4B (kshetrajna12 작):
초기 4B 결정 모델입니다.
JevBench에서의 JevK5의 위치: 4B 결정 에코시스템의 최고봉
- 대규모 폐쇄 테스트(1,624문제)에서 보여준 v0.3의 진정한 실력:
문제가 1,624개(폐쇄 720개)로 급증한 가혹한 v1.5.5 headline에서, JevK5 v0.3이 7위에 오르며 Imajev-4B(10위)를 따돌린 사실은, 이중 장기 숙고 증류(Double Long-Context Distillation) (27B + Luna)를 통해 얻은 '문맥의 깊이와 교정성(Calibration)'이 파인튜닝 모델을 장기적/통계적으로 능가함을 입증하는 것으로 보입니다.
③ 【실제 기기 교차】본 사이트에서 검증된 다른 4B 모델과 비교한 JevK5 v0.3의 포지셔닝
'4B 클래스의 결정 모델'로서, JevK5 v0.3은 다른 접근 방식과 비교하여 어떤 위치에 있을까요? 주요 4B 클래스 모델들과 비교한 매트릭스가 다음과 같습니다:
| 모델 | 아키텍처 / 방식 | VRAM | 단일 레이턴시 (p50) | S1Bench (분류5) | ECE (교정 오차) | 장문 계약서 (15문제) | 다지선다 (MASSIVE 60) | 4B 내에서의 위치와 특징 |
|---|---|---|---|---|---|---|---|---|
| JevK5 v0.3 ⭐ | Qwen3.5 + 이중 증류LoRA + 결정Logit | 약 7.95 GB | 72.3 ms | 86.80% | 0.061 | 100% (15/15) | 90.0% (ECE 0.035) | 현행 4B 클래스 단독 최고. 8B(Lev) 초과 지능과 상용급 교정성을 겸비. |
| Qwen3.5-4B (llama) | 범용 LLM 동결 + GGUF 어휘 Logit 직접 읽기 | 약 2.8 GB | 80~140 ms | 78.40% | 0.118 | 100% (15/15) | 74.0% | 메모리 절약성 최강(2.8GB). 다만 결정 헤드 미조정으로 자신도 교정이 거칠다. |
| Qwen3.5-4B (SGLang) | 범용 LLM + RadixAttention 캐시 탐색 | 약 20.4 GB | 60~90 ms | 78.40% | 0.118 | 100% (15/15) | 74.0% | 대량 문서 탐색 처리량 최고. 다만 VRAM을 20GB 독점하며 단독 운영 전제. |
| Kev-4B | Qwen3.5 + Gated DeltaNet 선형 Attention | 약 8.5 GB | 112 ms (병렬 20ms) | 77.20% | 0.124 | 66.7% (10/15) | 21.7% (붕괴) | Zero-Decode 병렬 저지연. 다만 고정 상태로 압축되면서 장문 세부나 다지선다에 한계. |
| SemIf / OpenJev | Qwen3.5-4B + 단일 장기 숙고 증류(초기형) | 약 8.7 GB | 약 400 ms | ~76.0% | ~0.110 | 미지원 | 64.0% | 초기 4B 결정 모델. JevBench 73.1을 기록했으나 CUDA Graphs 비통합으로 느리다. |
왜 JevK5 v0.3은 '4B를 껍데기로 한 8B'라고 불리는가?
- 이중 장기 숙고 교사(Qwen3.6-27B + GPT-6 Luna)에 의한 지능 밀도:
일반적인 4B 증류 모델은 단일 LLM에서 답변 레이블만을 증류합니다. JevK5는 2개의 프론티어 장기 숙고 모델이 생성한 17,408건의 사고 과정(결정 궤적)을 LoRA에 각인했기 때문에, 파라미터가 4B임에도 불구하고 Full Attention 8B 모델(Lev-8B의 85.60%)을 능가하는 86.80%의 논리 이해도를 보여줍니다.
- 압도적인 교정 정확도 (ECE 0.061):
다른 4B 모델(Qwen3.5 또는 Kev-4B)은 ECE가 0.11~0.13 근처에 머무는 반면, JevK5는 0.061로 거의 절반 수준을 달성하여 상용 주력 모델인 Jev(0.048)에 근접한 '통계적 정직성'을 자랑합니다.
- VRAM 8GB에서 3D 게임과 공존 가능:
SGLang처럼 20GB를 차지하지 않고 약 7.95 GB로 상주하며 70ms 만에 즉답하기 때문에, RTX 3090/4090 같은 소비자 환경에서도 **'실용적인 균형을 갖춘 4B 결정 모델'**로서의 입지를 확립했습니다.
3. 로컬 실기에서의 전 5단계 완벽 검증
이러한 국제 리더보드에서의 높은 평가가 일본 현지(일본어 문맥, 장문 계약서, 이중 부정, 5,000줄 의미 검색)에서도 진실인지 확인하기 위해, 로컬 RTX 3090 (24GB) 환경에서 실기 검증을 진행했습니다.
【Phase 1】 동화/경계 식별력 테스트 (13케이스 × 2명제)
문학적 은유나 '발언의 거짓 vs 신분 위장', '물리적 차단 vs 비밀 은폐'를 간파하는 경계 식별 테스트입니다.
- 구 명제(현행 프롬프트 / 의문형 플래그): 12/13 (92.3%)
- 신 명제(개선 프롬프트 / 대칭적 신분 판정): 12/13 (92.3%)
- 평균 단발 지연: 43.5 ms
【주요 케이스 실측 확률 및 판정】
・백설공주(변장) : P(disguised) = 98.79% [OK]
・신데렐라(이름을 밝히지 않은 채) : P(disguised) = 86.35% [OK]
...
특기할 점: Jeff-0.8B가 88.0%로 대오검지를 하고, Lev-8B (34.0%)나 주력 Jev (29.0%)에서도 망설임을 보인 '늑대 소년의 거짓말'을 JevK5는 19.24%로 가장 명확하게 배제했습니다. 또한, 주력 Jev가 95%로 대오인한 '학의 은혜를 갚는 문 닫기(물리적 차단)' 역시 22.6%로 회피하고 있습니다.
【Phase 2】 S1Bench 통합 하네스 평가 (300문제)
ADR-010 /v1/systemone
호환 엔드포인트를 통해 오픈 평가 하네스 levbench
의 6개 서브셋(각 50문제)을 순회했습니다.
| 서브셋 | 태스크 종류 | 문제 수 | 정답률 | p50 레이턴시 | Log-Loss | Brier Score | ECE (보정 오차) |
|---|---|---|---|---|---|---|---|
| boolq | 이진 판정(사실 대조) | 50 | 84.0% | 69.2 ms | 0.336 | 0.110 | 0.069 |
| paws | 구문 재변환 판정 | 50 | 86.0% | 49.6 ms | 0.463 | 0.139 | 0.136 |
| vitaminc-dev | 사실 검증/반론 | 50 | 84.0% | 72.1 ms | 0.604 | 0.331 | 0.193 |
| massive-en-US | 60클래스 의도 분류 | 50 | 90.0% | 235.7 ms | 0.351 | 0.154 | 0.035 |
| aegis2 | 안전성 가드레일 | 50 | 90.0% | 50.6 ms | 0.378 | 0.100 | 0.068 |
| helpsteer2 | 5단계 다치 점수 | 50 | 46.0% | 150.3 ms | 1.388 | 0.690 | 0.131 |
| 전체 요약 | S1Bench 종합 | 300 | 80.00% | 72.3 ms | 0.587 | 0.254 | 0.061 |
| 분류 5 태스크 | 분류만 (점수 제외) | 250 | 86.80% | 63.4 ms | 0.426 | 0.167 | 0.054 |
특기할 점:
분류 5 태스크 정답률 86.80%: Full Attention 8B 모델인 Lev-8B(85.60%)나 Kev-4B(77.20%)를 능가하며, 원본 Jev 1.13(87.60%)에 근접한 최고 점수를 기록했습니다. 60 선택지(MASSIVE)에서 90.0% 정답: 16개 선택지를 초과하는 다지선다형 문항에서 JevK5만의 독자적인 '다단계 낙오 방식(Knockout Spread)'이 위력을 발휘하여, 원본 Jev(88.0%)나 Lev-8B(82.0%)를 능가했습니다. 극히 낮은 교정 오차(ECE 0.061): 사전 학습 시 최적화된 온도 매개변수(temperature: 1.22, knockout_temperature: 0.93) 덕분에 확률의 신뢰성이 매우 높게 유지되었습니다.
【Phase 3】 장문 계약서・사양서 테스트 (15문항 / 1,200~1,450 tokens)
업무 위탁 계약서 및 기밀 유지 계약서(NDA)의 장문 컨텍스트 하에서의 국소 조항 탐색 능력입니다.
- 정답률: 15/15 (100.0%) (전 문항 완전 회상) -
- 평균 지연 시간: 291.4 ms (Lev-8B의 약 1.8초에서 대폭 단축) -
- 총 소요 시간: 4.37 초
【특기 사항: Jeff-0.8B・Kev-4B 와의 비교】
Kev-4B(66.7% / 10문항・평균 250 ms): Gated DeltaNet의 고정 은닉 상태로의 선형 압축 한계로 인해, 1,000 토큰을 넘는 장문 끝 부분의 국소 조항에서 정보가 매몰되어 5문항을 놓쳤습니다. Jeff-0.8B(66.7% / 10문항・평균 74.6 ms): 최적화 커널로 인해 74.6ms라는 모든 모델 중 가장 빠른 속도를 기록했지만, 0.8B라는 매개변수 용량의 한계로 복잡한 다중 계약 조건의 유지가 어려워 5문항을 오답했습니다. JevK5 v0.3(100.0% / 15문항・평균 291.4 ms): Qwen3.5-4B의 우수한 장문 어텐션으로, 손해 배상 상한이나 지식재산권 귀속의 예외 규정을 전 문항 확신도 0.99~1.00로 완벽하게 적중했습니다. Kev나 Jeff가 66.7%로 탈락했던 장문의 벽을, 단 한 문제도 놓치지 않고 291ms에 완전 돌파했습니다.
【Phase 4】 화용론・이중 부정 트랩 테스트 (20문항)
한-일의 부정 의문문(
⚠️ [IMG:N] 형식 토큰은 이미지 placeholder 입니다. 번역하지 말고 원래 위치에 그대로 유지하세요.
- 스캔 총 개수: 4,994 줄 -
총 소요 시간:237.28초 (3.95분) -
직렬 평균 레이턴시:47.51ms/질문 -
실효 처리량:21.05 줄/초 (직렬 1-concurrency HTTP) -
동화 인젝션의 간파 결과: - Line 500: 백설공주(몸을 쇠약하게 하다)[정답]
ightarrow 【탐지】P = 98.79% - Line 1500: 신데렐라(이름을 밝히지 않은 채)[정답]
ightarrow 【탐지】P = 86.35% - Line 2500: 벌거벗은 왕자님(영어)[해당 없음]
【탐지】P = 55.11% (영어 문맥에 의한 경계 탐지)
ightarrow - Line 3500: 양치기(거짓/늑대 소년)[해당 없음]
ightarrow 【제외 성공】 - Line 4200: 카구야히메(털어놓다)[해당 없음]
ightarrow 【제외 성공】 - Line 4800: 학의 은혜[해당 없음]
ightarrow 【제외 성공】
- Line 500: 백설공주(몸을 쇠약하게 하다)[정답]
【특기 사항: Jeff-0.8B・Kev-4B 와의 비교】
직렬 간 순수 비교라면 Kev-4B 의 2.4배 고속:
Kev-4B의 벤치마크 수치 '약 100초'는 병렬 배치로 구성했을 때의 추정치입니다. 같은 '직렬 1-concurrency(질문별 순차 전송)'끼리 비교했을 경우, Kev-4B (단발 112ms / 약 559초)에 비해 JevK5-4B는 47.5ms / 237초로 두 배 이상(2.4배) 빠르게 처리합니다. 병렬화를 통한 추가적인 성능 향상 여력:
이번 JevK5가 237초가 걸린 것은 클라이언트 측이 1 요청씩 순차 전송하는 완전 직렬 루프로 구동했기 때문입니다. 서버 자체는 멀티스레드 지원(ThreadingHTTPServer)을 하고 있으므로, 클라이언트에서 병렬(Concurrency 48)로 요청을 보내면, 100120초 전후 (초당 40~50 줄)까지 속도를 높일 수 있습니다. Jeff-0.8B (최속 91초) 대비 판정 해상도의 압도적 우위:
Jeff-0.8B는 단발 18ms라는 극소 파라미터의 강점으로 91초 (초당 55줄)로 가장 빠르게 처리했지만, 위양성(오탐지)이 다수 혼입되었습니다. JevK5-4B는 양치기나 학의 은혜를 명확히 제외하고, 비유적 문맥을 고정밀도로 포착하는 '높은 정확도'를 겸비했습니다.
4. 모든 결정 모델 총괄 마스터 비교표
과거에 검증한 모든 오픈 결정 모델, 상용 API 및 참고 모델의 동일 조건 비교 데이터를 아래에 정리합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기