Jeff-0.8B vs Kev-0.8B 실기 대결 | 0.8B급 판단 모델 최상위 격전 및 병렬 처리량 검증
요약
본 기사는 초경량(sub-1B) 모델의 고속 판단 능력을 검증하기 위해 Jeff-0.8B와 Kev-0.8B 두 모델을 비교 분석합니다. 동일한 환경에서 동화 경계 테스트, S1Bench 등 다양한 벤치마크를 통해 두 모델의 성능과 병렬 처리량을 실측 비교했습니다.
핵심 포인트
- Jeff-0.8B와 Kev-0.8B는 Qwen3.5-0.8B-Base를 기반으로 개발된 초경량 판단 모델입니다.
- 두 모델은 각각 GLA/CUDA 그래프 최적화와 하이브리드 선형 상태 공간 아키텍처를 채택했습니다.
- 다양한 벤치마크 및 병렬 처리량 테스트를 통해 두 모델의 성능을 실측 비교했습니다.
1. 서론: 0.8B급 판단 모델 최상위 격전의 배경
2026년 9월, TypeSafe AI가 발표한 'Jev (Typed Decision Head)'는 LLM에서 토큰 생성 루프를 완전히 배제하고, 신경망의 잠재 표현(latent representation)으로부터 직접 '타입 지정 판단(typed decision)'을 출력하는 고속 System 1 아키텍처로서 큰 주목을 받았습니다.
이후 오픈소스 커뮤니티에서는 4B~8B 클래스 (JevK5, Kev-4B, Lev-4B 등)의 재현 및 진화가 진행되는 한편, **'1B 미만(sub-1B)의 초경량 모델로 어디까지 고속이면서도 고정도의 판단이 가능한가?'**라는 프론티어가 빠르게 개척되고 있습니다.
그 대표격이 아래 두 가지 0.8B급 모델입니다:
Jeff-0.8B (firelex/jeff)
GitHub: firelex/jeff -
Hugging Face: mstrasser/Jeff-Qwen3.5-0.8B
Qwen3.5-0.8B-Base를 골격으로 삼고, Gated Linear Attention (GLA)과 고속 CUDA 커널을 융합한 결정 모델.
Kev-0.8B (jaredpalmer/kev-0.8b)
GitHub: jaredpalmer/kev -
Hugging Face: jaredpalmer/kev-0.8b
마찬가지로 Qwen3.5-0.8B-Base를 백본으로 삼고, Gated DeltaNet (18층) + Full Attention (6층) + Pointer Head를 조합한 하이브리드 선형 상태 공간 결정 모델.
본고에서는 동일 머신(RTX 3090 24GB), 동일 하네스(ADR-010 /v1/systemone 호환), 동일 평가 데이터셋을 사용하여, 두 모델의 동화 경계 테스트 (13문항), S1Bench (300문항), 장문 계약서 테스트 (15문항), 화용론 및 이중 부정 테스트 (20문항), 그리고 **5,000행 의미 grep (직렬 & 병렬 Concurrency 4)**을 완전 실측 비교한 결과를 보고합니다.
2. 아키텍처와 검증 환경
① 모델 사양 비교
| 항목 | Jeff-0.8B (firelex/jeff ) | Kev-0.8B (jaredpalmer/kev-0.8b ) |
|---|---|
| 공개 리포지토리 | GitHub (firelex/jeff) | GitHub (jaredpalmer/kev) |
| 베이스 모델 | Qwen3.5-0.8B-Base | Qwen3.5-0.8B-Base |
| 아키텍처 | GLA (causal-conv1d + fla ) | Gated DeltaNet (18층) + Multi-Head Attention (6층) + Pointer Head |
| 추론 최적화 | Bucketed CUDA Graphs (256/512/1024/2048) | 표준 PyTorch 구현 (LoRA merge 완료) |
| 상주 VRAM | 1.69 GB | 1.43 GB |
| 서버 기동 시간 | 30.4초 (1) | 159.8초 (1) |
| API 호환성 | ADR-010 /v1/systemone (:8092) | ADR-010 /v1/systemone (:8094) |
*(1 기동 시간 차이에 대하여): 이는 내부 로드 처리의 차이에서 기인합니다. Jeff-0.8B는 사전에 단일 가중치로 패키징되어 있어, 로드(16초) + CUDA Graph 캡처(14초)로 총 30초가 소요됩니다. 반면 Kev-0.8B는 프레임워크 (ck.load)의 사양상, 기동 시 Qwen3.5-0.8B-Base와 LoRA 어댑터 (DeltaNet/Pointer Head)의 CPU/GPU 결합 병합 처리를 매번 실행하기 때문에 초기화에 약 150초가 소요됩니다 (사전에 전체 가중치로 내보내기 저장하면 다음부터는 단축 가능).
② 평가 환경
GPU: NVIDIA GeForce RTX 3090 (24GB VRAM, PCIe 4.0 x16) -
OS / 호스트: Windows 11 Pro / WSL2 (Ubuntu 24.04 LTS) -
CUDA / PyTorch: CUDA 12.6, PyTorch 2.6.0+cu126, Python 3.11 -
측정 방법: 동일 클라이언트에서 HTTP JSON 요청을 전송하여 End-to-End의 실효 응답 시간을 측정.
3. 완전 대결 마스터 테이블
총 5개 페이즈에 걸친 실기 측정 결과의 나란히 비교 목록입니다.
| 평가 페이즈 / 지표 | Jeff-0.8B (firelex/jeff ) | Kev-0.8B (jaredpalmer/kev-0.8b ) | 승자 / 판정 고찰 |
|---|---|---|---|
| ① 동화 경계 (구 명제 13문) | 69.2% (9/13) | 84.6% (11/13) | Kev-0.8B의 승리 (+15.4%) |
| ① 동화 경계 (신 명제 13문) | 84.6% (11/13) | 84.6% (11/13) | 동률 (※상세) |
| ↳ 늑대 소년(단순 거짓말) 간파 | 오인 (변장 P=88.0%) | 간파 성공 (변장 P=48.5%) | Kev-0.8B가 우수하게 간파 |
| ↳ 백설공주(몸을 꾸미는) 간파 | 간파 성공 (변장 P=83.3%) | 오인 (변장 P=43.1%) | Jeff-0.8B가 간파 |
| ↳ 평균 레이턴시 | 19.8 ms | 152.0 ms | Jeff가 약 7.7배 빠름 |
| ② S1Bench (분류 5태스크 250문) | 88.8% (222/250) | 59.6% (149/250) | Jeff-0.8B의 압승 (+29.2%) |
| ↳ BoolQ (참거 판정 50문) | 86.0% | 78.0% | Jeff 우위 |
| ↳ PAWS (言い換え 판정 50문) | 94.0% | 62.0% | Jeff 우위 |
| ↳ VitaminC (사실 검증 50문) | 86.0% | 60.0% | Jeff 우위 |
| ↳ Massive-US (의도 분류 50문) | 94.0% | 36.0% | Jeff 압승 |
| ↳ Aegis2 (안전성 판정 50문) | 84.0% | 62.0% | Jeff 우위 |
| ↳ HelpSteer2 (점수 50문) | 18.0% (※2 근사 채점) | 26.0% | Kev가 점수 추종 |
| S1Bench 전 6태스크 종합 (300문) | 76.7% (230/300) | 54.0% (162/300) | Jeff 우위 |
| S1Bench 교정 오차 (ECE) | 0.070 | 0.140 | Jeff-0.8B의 승리 (고신뢰도) |
| S1Bench 추론 지연 (p50) | 15.7 ms | 150.4 ms | Jeff-0.8B가 약 9.6배 빠름 |
| ③ 장문 계약서 테스트 (15문) | 100.0% (15/15) | 53.3% (8/15) | Jeff-0.8B의 완승 |
| ↳ 평균 레이턴시 | 74.6 ms | 153.5 ms | Jeff가 약 2배 빠름 |
| ④ 화용론・이중 부정 (20문) | 75.0% (15/20) | 45.0% (9/20) | Jeff-0.8B의 승리 (+30.0%) |
| ↳ 평균 레이턴시 | 78.7 ms | 160.9 ms | Jeff가 약 2배 빠름 |
(※2 HelpSteer2 의 18.0% / 26.0% 채점에 대하여): S1Bench의 HelpSteer2는 0~4의 5단계 점수(Likert 척도)를 평가하는 score 타입 태스크입니다. Jeff-0.8B의 현행 ADR-010 어댑터는 2진 판정(bool) 및 다지선다(choice)에 특화하여 구축되었으며, 직접적인 점수 회귀 핸들러를 가지고 있지 않습니다. 따라서 공식 평가 하네스(levbench) 준거의 폴백 처리(출력 확률 분포의 최대 인덱스를 점수에 기계적 매핑)를 적용한 결과, 18.0% (9/50)의 정답이 되었습니다. 다만, 5지선다 평가에서의 무작위 추측 기대값(20.0%)과 거의 동등 수준이며, Jeff가 점수 수치를 이해하여 평가했다기보다는, 확률 분포의 편리에 의한 우발적 일치에 가깝습니다 (엄밀하게 score 타입 출력을 요구하는 스크립트에서는 0.0%가 됩니다).
한편, Kev-0.8B는 다치 확률(multi-value probability)에서 기대값(expected value)을 계산합니다.
이번에 실시한 각 검증 개요 및 선행 연구
본고에서 실시한 각 검증은 선행 기사에서 JevK5, Kev-4B, Lev-4B, 본가 Jev 등의 성능을 실기(실제 장비)로 확인하기 위해 설계된 것을 재활용했습니다:
- 동화 경계 테스트 (13케이스): 표면적인 거짓말(늑대 소년)과 진정한 신분 은폐(신데렐라, 백설공주)를 구별할 수 있는지 검증하는 화용론적 테스트입니다. 이전 명제(질문 형식 프롬프트)에서는 Kev-0.8B가 84.6% 대 69.2%로 앞섰으나, 명제의 대칭성을 맞춘 '새로운 명제'에서는 양쪽 모두 84.6%(13/13)의 동률에 도달합니다(※상세 해설). -
S1Bench (300문항): TypeSafe ADR-010 규격으로 정한 진위 판별, 의역, 사실 검증, 의도 분류, 안전성, 스코어링의 종합 분류 벤치마크입니다. -
장문 계약서 테스트 (15문항): 2,0004,500 토큰 분량의 실무 계약서에서 특정 조항(손해배상 상한액, 합의 관할 등)을 국소적으로 회상할 수 있는지 검증하는 테스트입니다. -
화용론/이중 부정 테스트 (20문항): '
아닐 수는 없다'와 같은 다중 부정이나 예외 조항에 대한 논리 반전 내성 테스트입니다.
각 벤치마크의 설계 배경 및 다른 모델(JevK5, Lev-4B, 본가 Jev 등)의 실측 데이터는 선행 기사 [Jev는 로컬 모델로 대체 가능한가? lev・jeff를 추가하여 추가적으로 실기 철저 비교] 및 [JevK5 v0.3 실기 검증|Jev Decision Index・JevBench 평가와 전 판단 모델 비교 마스터표]를 참고해 주십시오.
4. 5,000행 의미grep 실기 벤치마크 (직렬 & 병렬 Concurrency 4)
나츠메 소세키 『오쿠베테는 고양이이다』 본문 4,988행에 동화 6문을 삽입한 총 4,994행에 대한 '등장인물이 변장/정체를 숨기고 있는가?'의 전반적 검사 벤치마크입니다.
※이 5,000행 의미grep의 검증 프로토콜 및 JevK5 (4B)나 Lev-4B의 실측 상세에 대해서는 [JevK5 v0.3 실기 검증 기사]의 제6장을 참고해 주십시오.
측정 결과 요약
| 측정 조건 | Jeff-0.8B (:8092) | Kev-0.8B (:8094) | 속도/성능 비교 |
|---|---|---|---|
| 직렬 스캔 (Concurrency 1) | |||
| ・처리량 | 54.66 행/초 | 5.08 행/초 | Jeff가 10.8배 빠름 |
| ・전체 4,994행 검색 시간 | 91.37 초 (1.5분) | 983 초 (16.4분 환산) | Jeff라면 1시간 반 만에 완료 |
| ・평균 레이턴시 | 18.29 ms | 196.94 ms | Jeff가 압도적으로 낮은 지연 시간 |
| 병렬 스캔 (Concurrency 4) | |||
| ・처리량 | 68.82 행/초 | 5.82 행/초 | Jeff가 11.8배 빠름 |
| ・전체 4,994행 검색 시간 | 72.56 초 (1.2분) | 857 초 (14.3분 환산) | Jeff가 18.8초 단축 |
| ・1행당 실효 비용 | 14.5 ms | 171.8 ms | Jeff의 병렬 처리가 압도적 |
| 노이즈 내성(오탐률) | |||
| ・고양이 본문의 오검지율 | 19.8% (989 / 4,988건) | 9.6% (48 / 500건) | Kev-0.8B의 압승(노이즈가 절반 이하!) |
| ・동화 감지 민감도 | 4/6 건 검출 (고감도) | 2/6 건 검출 (보수적) | Jeff는 적극 탐지, Kev는 엄격함 |
병렬화를 통한 동작 차이
- Jeff-0.8B:
Bucketed CUDA Graphs 덕분에 CPU-GPU 간 디스패치 오버헤드가 거의 0에 가까워졌기 때문에, Concurrency 4의 병렬 클라이언트로부터 동시에 요청을 보내자 GPU 파이프라인이 빈틈없이 채워지면서 처리량이 54.7 행/초를 기록했습니다. 전체 4,994행이 단 68.8행/초(약 1.26배)로 향상되어 $
ightarrow$ 72.56초 만에 완료합니다. -
Kev-0.8B:
모델 내부의 forward 패스(Gated DeltaNet + Multi-Head Attention + Pointer Head)가 표준 PyTorch 구현이며, 리퀘스트당 GPU 계산 시간(약 150160ms)이 지배적입니다. 병렬화하더라도 처리량은 5.085.82 행/초(+14%)의 미미한 증가에 그치며, CUDA Graph 최적화 유무가 처리량을 결정짓는 핵심 요소임이 밝혀졌습니다.
5. 각 단계별 상세 분석
① 동화 경계 테스트 (문맥 및 신분 파악)
동화 경계 테스트 구(舊) 명제와 신(新) 명제의 차이점 및 신명제로 동률이 되는 이유
동화 경계 테스트(총 13개 케이스)에서는 표면적인 거짓말이나 연기, 물리적 가림막, 신분 사칭 등의 경계 사례에 대해 결정 모델이 어휘의 인상에 현혹되지 않고 진정한 신분 상태를 식별할 수 있는지 검증합니다.
본 검증에서 프롬프트 설계(명제 형식)에 따라 두 모델의 승패가 크게 변화했습니다:
1. 구 명제(질문형 프롬프트)와 신 명제(대칭 판정 프롬프트)의 차이점
- 구 명제(현행 질문형 플래그): 판정 기준**:
등장인물이 변장하고 있거나 정체를 숨기고 있는가?
disguised
: 변장했거나, 몸을 숨겼거나, 정체를 속이고 있다.
not_disguised
: 변장하지 않았고, 솔직하며, 비밀을 공개했거나, 정상적인 상태이다.
-
문제점: 질문형이며 '비밀을 공개했다', '솔직하다'와 같은 비대칭적인 설명문이 포함되어 있어, 모델이 '비밀', '숨기다'라는 단어의 동시 출현에 과민하게 반응하기 쉽습니다.
-
신 명제(대칭적 신분 판정 프롬프트): 판정 기준**:
글 속 인물의 '신분이나 정체'에 대해, 어느 설명이 가장 부합하는가?
disguised
: 본래의 신분이나 정체를 의도적으로 위장하여 숨기고 있다.
not_disguised
: 본래의 신분이나 정체는 위장하지 않았으며, 자신의 신분을 숨기지 않고 있다.
- 개선점: 두 선택지 모두 '본래의 신분이나 정체를~'로 시작하는 완벽하게 대칭적인 서술에 맞추어, 단순한 감정어 또는 물리적 가림막의 노이즈를 배제하고 '신분/신원 얼라인먼트(alignment)'에만 초점을 맞췄습니다.
2. 왜 신 명제를 사용했을 때 두 모델 모두 84.6%(11/13)로 동률이 되는가?
구 명제에서는 어휘 편향에 이끌린 Jeff-0.8B가 69.2%(9/13)에 그쳤고, 보수적이며 오탐지율이 낮은 Kev-0.8B가 84.6%(11/13)로 승리했습니다.
그러나 신 명제를 투입하자 두 모델 모두 84.6%(11/13 정답)로 동률이 됩니다. 그 내역은 다음과 같습니다:
- Jeff-0.8B의 개선(69.2% ➔ 84.6%):
Jeff는 구 명제에서 '스파이 신분 제시(수첩을 공개함)'나 '카구야 공주(달로 돌아가는 비밀을 밝힘)'를 '스파이', '비밀'이라는 단어에 끌려 잘못 판단했습니다. 하지만 신 명제로 '신분을 위장하여 숨기고 있는지 여부'를 대칭적으로 묻자, 술어 상태 반전(공개/고백)을 올바르게 추적할 수 있게 되어 2문제를 만회하며 84.6%로 급상승했습니다.
- Kev-0.8B의 특성(84.6% 유지):
Kev-0.8B는 Gated DeltaNet의 강력한 보수성(저노이즈성) 덕분에 구 명제 시점에서도 이미 84.6%를 달성했습니다. 신 명제에서도 높은 식별력을 유지하며, 늑대 소년의 단순 거짓말을 **48.5%**로 간파(배제)하는 데 성공했습니다.
-
두 모델의 강점/약점 대비:
-
늑대 소년 (단순 발언의 거짓): Kev-0.8B는 변장 P=48.5%로 간파에 성공했습니다. Jeff-0.8B는 '거짓 = 위장'이라는 어휘 연상 때문에 P=58.2%(구 명제에서는 88.0%)로 변장으로 오판했습니다.
-
백설공주 (노파로 변장): Jeff-0.8B는 '몸을 여미다(身をやつし)'라는 고풍스러운 변장 표현을 P=62.2%(구 명제에서는 83.3%)로 정답 감지했습니다. 반면 Kev-0.8B는 P=43.1%로 너무 신중하여 변장을 놓쳤습니다.
이처럼 프롬프트의 대칭성을 갖추어 어휘 노이즈를 제거하자, 0.8B 클래스로서의 종합적인 논리 이해도는 84.6%로 팽팽하게 맞섰으나, **'적극 탐지형 Jeff(놓치는 것이 적음)' vs '신중/엄격 판정 Kev(오탐지가 적음)'**라는 아키텍처에서 기인한 명확한 성향 차이가 나타난 결과였습니다.
백설공주의 명암:
한편, '여왕이 상인 노파로 변장하여'라는 고풍스러운 표현에 대해서는, Jeff-0.8B가 P=83.3%로 정답한 반면, Kev-0.8B는 P=43.1%로 '변장이 아니다'라고 오판했습니다. 어휘를 파악하는 데 특징적인 차이가 나타납니다.
② S1Bench 300문항 (자연어 이해 및 교정)
- 분류 작업에서의 Jeff의 압도적 완성도:
다의어 판별(PAWS: 94.0%), 사실 검증(VitaminC: 86.0%), 의도 분류(Massive: 94.0%) 등 다양한 자연어 처리 태스크에서, Jeff-0.8B는 4B Full Attention 모델(Lev-4B: 85.6%)마저 능가하는 **88.80%**를 기록했습니다. - ECE (교정 오차)의 차이:
모델이 출력하는 확률 점수의 정직함(자신도와 실제 정답률의 일치도)을 나타내는 ECE에서, Jeff-0.8B는 0.070으로 매우 날카로운 교정을 보여주었습니다. Kev-0.8B (0.140) 역시 소형 모델로서는 양호하지만, Jeff의 미세 조정된 정교함이 두드러집니다.
③ 장문 계약서 & 화용론
- 장문 회상(15문항):
2,000~4,500 토큰 분량의 장문 계약서에서 특정 조항(손해배상 상한액, 합의 관할권, 권리 이전 시기 등)을 회상하고 판별하는 테스트에서, Jeff-0.8B는 **15문항 만점(100.0%)**을 달성했습니다. Kev-0.8B는 8/15 (53.3%)에 그쳐, 장문 문맥 유지 능력에서는 GLA 아키텍처의 Jeff가 우세합니다. - 이중 부정・예외 논리(20문항):
'~라고 말할 수 없다', '~를 제외하고 ~가 아닌 한'과 같은 다중 부정 함정에서, Jeff-0.8B는 15/20 (75.0%)였고, Kev-0.8B는 9/20 (45.0%)였습니다.
④ 왜 이토록 큰 속도 차이(10배 차)가 발생하는가? 아키텍처와 추론 최적화의 심층 분석
본 검증에서 기록된 '단발 15.7ms vs 150.4ms (약 9.6 배)', '병렬 처리량 68.8 행/초 vs 5.8 행/초 (약 11.8 배)'라는 압도적인 속도 차이의 원인은, 모델의 파라미터 수(둘 다 약 0.8B)가 아니라, **'추론 런타임 최적화 스택의 유무'**에 있습니다.
1. Jeff-0.8B만이 갖춘 '삼중 최적화 스택'
Jeff-0.8B는 다음 세 가지 선진적인 가속 기술을 풀스택으로 통합하고 있습니다:
:causal-conv1d
1차원 인과 컨볼루션 처리를 표준 PyTorch가 아닌, 전용 고속 수작업 CUDA 커널로 실행하여 메모리 대역폭의 불필요한 왕복(round trip)을 줄입니다.:fla
(Flash Linear Attention)
GLA (Gated Linear Attention)의 선형 순환 상태 업데이트를 FlashAttention 스타일의 타일링・온라인 소프트맥스 융합 커널로 실행하여 GPU 연산기를 최대 가동합니다.- Bucketed CUDA Graphs (256 / 512 / 1024 / 2048):
가변 길이 텍스트를 버킷 단위로 좌측 패딩 고정하고, GPU의 커널 시작 시퀀스를 사전에 VRAM에 완전 정적(static)으로 캡처합니다. 추론 시 CPU 측 Python 오버헤드 및 커널 시작 디스패치 지연을 물리적으로 거의 제로화(순 순방향 계산 단 7.77ms)했습니다.
2. Kev-0.8B는 왜 느린가? 고속화할 방법이 있는가?
한편, Kev-0.8B는 Gated DeltaNet (18층) + Multi-Head Attention (6층) + Pointer Head라는 고급 하이브리드 구조를 채택하고 있지만, 현시점에서는 다음 상태에 있습니다:
- 현행 병목 지점 (순수 PyTorch 구현):
Kev-0.8B는 공식 참조 구현(표준 PyTorch의 eager 모드) 그대로 동작하고 있습니다. DeltaNet의 상태 업데이트나 Attention, Pointer Head 등 여러 곳에서 Python/PyTorch의 세부 커널 시작이 수십 번 이상 발생하여, 매 질문마다 150ms가 넘는 CPU-GPU 간 디스패치 지연에 가려지고 있습니다. - Kev-0.8B를 고속화할 방법은 있는가?
기술적으로 가속화할 여지는 매우 큽니다:
- DeltaNet의 커스텀 CUDA 커널화: Flash-Linear-Attention이나 Triton을 사용하여 DeltaNet의 재귀 상태 업데이트를 통합(Fused Kernel 化)합니다. -
CUDA Graphs 적용: 가변 길이 입력을 버킷화하고, GPU 상에서 정적 그래프로 캡처합니다. -
ONNX / TensorRT-LLM으로 Export: Kev-4B에는 자발적으로 ONNX 버전(onnx-community/kev-4b-ONNX)이 존재하는 것처럼, Kev-0.8B도 정적 그래프로 TensorRT나 ONNX Runtime에 올림으로써 이론상 20~30ms급 단축이 가능합니다.
공식 대응을 기다리는 상황인가?:
현재 시점에서는 원저자(Jared Palmer 등)의 공식 리포지토리에서 0.8B 버전 전용 Triton 커널이나 CUDA Graph 런타임이 아직 포함되어 있지 않아, **'공식적인 추론 최적화 업데이트를 기다리거나, 커뮤니티가 TensorRT/Triton으로 구현하기를 기다리는 상태'**라고 할 수 있습니다. 따라서 지금 당장 '로컬에서 초당 수십 건을 처리하는 초고속 트리아지'를 하고 싶다면, 최적화가 이미 완료된 Jeff-0.8B의 독무대입니다.
6. 요약: 0.8B급 결정 모델 활용 가이드라인
이번 철저한 검증을 통해, 같은 Qwen3.5-0.8B를 기반으로 하지만 두 결정 모델 간의 캐릭터와 강점이 극명하게 나뉘는 것을 확인했습니다.
-
'Jeff-0.8B'를 선택해야 하는 시나리오:
대량 데이터의 초고속 의미 검색(grep): 로그 스캔, 문서 필터링, 스트리밍 모니터링 등 초당 수십~수백 건의 판단이 요구되는 실시간 파이프라인.
장문맥・복잡 논리의 즉답: 수천 토큰 분량의 문서에 대한 조항 판정이나, 중첩 부정을 포함하는 자연어 판정. -
'Kev-0.8B'를 선택해야 하는 시나리오:
노이즈를 싫어하는 상주형 가드레일: 위양성(False Positive)을 극도로 피하고 싶은 안전 필터나, 엄격한 입력 유효성 검사.
초저메모 환경: 대뇌 LLM과 동일 GPU에서 초소형 풋프린트로 공존시키며 오탐지율이 낮은 판정을 하고 싶을 경우.
서브 1B라는 극소 사이즈임에도 불구하고, 두 모델 모두 고유의 강점을 발휘하고 있어, 태스크 특성에 맞게 적절히 사용함으로써 로컬 AI 에이전트의 System 1(직관/반사층)을 강력하게 지원하는 무기가 됩니다.
7. 부록 (Appendix): 초경량 1B 이하 클래스의 세력도와 Jeff-0.8B의 추정 위치
본고에서 고속 에지 트리아지 역할로 다룬 'Jeff-0.8B' (GitHub: firelex/jeff, Hugging Face: mstrasser/Jeff-Qwen3.5-0.8B, Qwen3.5-0.8B 증류 모델)는 Benchmark Heaven (JevBench) 및 Jev Decision Index의 공식 리더보드에 미참전(미등록) 상태입니다.
여기서는 전 세계 2대 벤치마크 사이트(Benchmark Heaven / JevBench v1.5.5 및 Jev Decision Index)에서 파라미터 **1B 이하(Sub-1B)**의 초경량 결정 모델들이 어떤 위치에 순위권에 있는지 정리하고, 나아가 본 실기 검증 결과를 바탕으로 '만약 Jeff-0.8B가 참가했다면 예상되는 순위 및 점수'를 논리적으로 추정하여 기록합니다.
1. Benchmark Heaven / JevBench (v1.5.5 · 109 시스템)
JevBench v1.5.5에 등록 및 측정된 1B 이하의 주요 모델은 다음과 같습니다:
| 순위 | 모델명 | 파라미터 | 방식 / 아키텍처 | 특징・비고 |
|---|---|---|---|---|
| #42 | Von | 395M | Option-Marker | 395M의 초소형 모델. Capability(능력) 점수 순으로는 42위에 랭크됨. |
| #45 | kev 0.6B | 0.6B | Gated DeltaNet | Jared Palmer가 제작. 선형 어텐션 기반의 초경량 에이전트 제어 모델. |
| #46 | lev-350m | 350M | LFM2.5-350M | Franck Verrot가 제작. 초경량 소형 모델. |
| #72 | SimpleJev (Qwen3.5-0.8B) | 0.8B | Qwen3.5-0.8B (CPU) | featherless-ai가 제작. CPU용 경량 결정 튜닝 모델. |
| #76 | Bosun v3.1 0.6B | 0.6B | Qwen3-0.6B LoRA | Hanno Labs가 제작. v1.5.5에서 공식 측정됨. |
| #78 | Deem 0.8B v1 | 0.8B | 증류 모델 | 0.8B 클래스의 결정 모델. |
| #82 | Raw Qwen3 0.6B | 0.6B | direct logits | Qwen3-0.6B의 어휘 Logit 직접 읽기. |
| #83 | GLiNER2.5 small | 74M | GLiNER | Fastino가 제작. 단지 74M의 초소형 인코더. |
| #95 | kev 0.5B | 0.5B | Gated DeltaNet | kev의 초소형 변종(variant). |
| #96 | Laya | 421M | ModernBERT-large | Convai Innovations가 제작. 421M 양방향 인코더. |
※ 참고로, JevBench에 등록된 jeff (#87)는 본고의 firelex/jeff (Qwen3.5-0.8B)가 아니라, Logan Markewich가 제작한 GLiFormer 400M이라는 별도의 모델입니다.
2. Jev Decision Index (Hugging Face Spaces · 70 시스템)
13.2만 건의 포괄적 분류 태스크(Decision Index)에서, 1B 이하로 랭크된 모델은 다음과 같습니다:
AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기