Kev는 매번 같은 답변을 내놓는다. 배치 처리할 때까지는.
요약
본 기사는 Jev 유사 모델(Kev-4B)의 결정론적 특성을 테스트한 후속 분석입니다. 단일 요청 시에는 답변이 일관되지만, 여러 요청을 동시에 처리하는 배치(batch) 환경에서는 확률 값이 변화하여 결과에 영향을 미칠 수 있음을 보여줍니다.
핵심 포인트
- 단일 요청 시 Kev-4B 모델은 높은 재현성을 보이며 안정적입니다.
- 실제 서비스 트래픽처럼 배치를 사용하면 확률 값의 변화가 발생합니다.
- 배치 처리 환경에서의 성능 검증이 중요하며, 이는 실제 운영 환경을 반영합니다.
Kev는 매번 같은 답변을 내놓는다. 배치 처리할 때까지는.
jev-decision-models에 대한 두 번째 파트입니다 (http://dev.to/guichard/jev-is-the-best-decision-model-heres-what-to-run-when-you-cant-use-it-mme). Part 1에서는 일곱 개의 오픈 소스 Jev 유사 모델을 단일 8 GB GPU에 올렸습니다. 이번 후속 기사에서는 우승 모델이 재실행 시에도 답변을 유지하는지, 동시 부하가 '결정론적(deterministic)' 모델에 어떤 영향을 미치는지, 그리고 헤드라인 수치가 얼마나 확실한지를 테스트합니다. 게다가 새로운 참가자인 Julia-1도 포함했습니다.
Mark Vange · Autom8ly · 2026년 9월 · 7분 분량
대부분 AI가 작성했습니다. 첫 번째 기사와 마찬가지로, 이 글과 그 분석은 저의 지시에 따라 저희 AI 어시스턴트(Autumn)에 의해 주로 생성되었습니다. 모든 숫자는 실제 실행에서 나온 것이며, 스크립트와 예측값은 공개되어 있습니다.
지난주 말 저는 단일 8 GB GPU에서 Jev 유사 모델을 실행하는 것에 대해 글을 썼습니다. 그중 가장 우수한 Kev-4B를 4비트로 양자화한 모델이 Jev의 0.968에 대해 0.872점을 기록했으며, 이 모델의 신뢰도는 약 3/4 분기의 결정을 자동화하기에 충분히 믿을 만해 보였습니다.
Poisson Labs의 설립자인 Taylor Kolasinski가 이를 읽고 적절한 질문들을 던졌습니다. 그들의 팀은 방금
첫 번째 질문은 두 가지 답변을 내놓았고, 두 번째 답변이 흥미롭습니다.
한 번에 하나의 요청: 반복해도 동일하다
9월 28일, 우리는 Kev-4B 4-bit 모델에게 동일한 866개의 질문을 세 번 더, 한 번의 요청씩 보내고 매번의 답변을 9월 26일 원본 실행 결과와 비교했습니다.
우리는 아무것도 조작된 것이 아님을 확인했습니다. 우리의 게이트웨이는 응답 캐시가 없으며, Kev 서버는 가장 최근의 네 가지 입력만 캐싱하므로, 반복할 때마다 866개의 다른 입력으로 인해 모든 답변은 처음부터 계산되었습니다. Kev의 API는 확률을 소수점 넷째 자리까지 반올림하므로, '동일하다'는 것은 그 해상도에서 동일함을 의미합니다.
부하 조건: 배치 처리가 숫자를 변화시킨다
실제 서비스 트래픽은 한 번에 하나의 요청으로 도착하지 않습니다. Kev 서버는 대기 중인 모든 요청을 수집하여 GPU를 통해 하나의 배치로 함께 실행합니다. 그래서 우리는 2개, 4개, 8개, 그리고 16개의 요청을 동시에 보낸 전체 테스트 세트를 다시 실행했고, 배치가 적용된 실행 결과가 서로 일치하는지 확인하기 위해 8개 요청으로도 한 번 더 실행했습니다.

실제로 실행된 배치 크기별로 그룹화했을 때, 이 선은 뚜렷합니다. 8개 요청으로 처음 실행했을 때는 단독 또는 쌍으로 실행된 116개의 요청 중 어느 것도 변경되지 않았지만, 7개 배치를 통해 실행된 735개 중 311개가 변경되었습니다. 모든 실행에 걸쳐 단독 또는 2~3개 배치로 실행된 2,015개의 요청은 모두 비트 단위로 동일했으며, 5개 이상 배치에서는 2,315개 중 1,223개가 변경되었습니다. (정확히 4개 배치는 형성되지 않았습니다.)

8개의 질문 중 403개에서 서로 다른 답변이 나온 두 번의 배치 실행(batched runs)은, 어떤 요청들이 같은 배치를 구성하는지가 타이밍에 달려 있기 때문입니다. 따라서 부하가 걸리면 Kev는 재현 가능하지 않게 됩니다. 즉, 동일한 요청이라도 함께 작동하는 다른 요소들에 따라 미묘하게 다른 숫자로 돌아올 수 있습니다. 이는 Poisson Labs가 훨씬 작은 규모에서 Jev를 통해 측정한 것과 같은 종류의 행동입니다.
결정에 미치는 영향은 작았습니다. 세 번의 배치 실행에 걸쳐 2,598개의 답변 중 2개가 최고 선택지를 변경했으며, 이 중 하나는 정답을 오답으로 만들었습니다. 이것이 한 실행의 점수가 0.8707인 이유입니다. 두 번의 변화 모두 두 옵션 간의 차이가 매우 적은 질문에서 발생했습니다. 한 문법 질문에서는 상위 두 옵션이 0.3013과 0.3042에서 각각 0.3043과 0.3040으로 이동했습니다. 어떤 답변도 0.9 라인을 넘지 못했습니다.

배치 처리의 이점은 거의 없었습니다. 한 번에 16개의 요청을 처리했을 때 GPU에서 45% 더 높은 처리량(throughput)을 얻었지만, 각 요청이 기다리는 시간은 거의 열 배나 길어졌습니다. 이 작은 카드에서는 모델이 한 번에 하나의 요청만으로도 이미 GPU를 잘 사용하고 있습니다.
이러한 현상이 발생하는 이유는 저희의 해석일 뿐이며 추적한 것은 아닙니다: GPU 산술 연산(GPU arithmetic)은 정확히 결합법칙(associative)을 따르지 않으며, 더 큰 배치는 다른 순서로 분할되고 합산될 수 있습니다. Kev의 서버도 더 큰 배치들을 다르게 처리하며, 이는 우리가 본 급격한 선에 부합합니다.
감사자에게 결정을 재현해야 한다면, 배치를 작게 유지하거나 모델이 실제로 반환한 확률을 기록하십시오. 조용한 서버에서의 결정론(Determinism)은 프로덕션 환경에서의 결정론이 아닙니다.
75%가 90% 임계값을 사용하지 않았지만, 낙관적이었습니다
처음부터 설명했어야 했습니다. '오류율 5% 이하로 자동화 가능(Automatable at 5% error)'은 90% 임계값을 사용하지 않습니다. 가장 자신감 있는 답변부터 순서대로 정렬하고, 오류가 허용된 답변을 최대한 많이 수락합니다. 이때 수락된 답변들의 오류율이 5% 이하를 유지하는 것입니다. 이 임계값은 결과에 따라 결정됩니다.
Taylor의 직감은 여전히 옳았습니다. 우리는 이 점수를 매긴 동일한 866개의 질문으로 그 임계값을 설정했는데, 이는 우리에게 유리하게 작용합니다. 제대로 수행한다면, 무작위로 절반을 선택하여 임계값을 정하고 나머지 절반에 적용하는 과정을 2,000번 반복해 보십시오:

커버리지는 유지됩니다. 주의해야 할 부분은 오류율입니다. 5%를 목표로 설정하고, 약 430개의 새로운 결정 샘플에 대해 테스트하면 2%에서 8.7% 사이의 수치가 나올 것입니다. 만약 5%가 엄격한 제한이라면, 자체 레이블링된 데이터셋으로 더 낮은 예산을 설정해야 합니다.
몇 개의 질문이 필요하며, 얼마나 확신할 수 있는가
이 테스트 스위트는 49개의 작업에 걸친 866개의 질문으로 구성되어 있으며, 각 사례당 하나의 질문을 사용합니다. 사례를 재샘플링하면 다음과 같은 95% 신뢰 구간이 나옵니다:
Jev와의 격차는 실재합니다: 구간의 가장자리에서도 7포인트가 넘습니다. Kev의 0.1% 신뢰도 오류율은 단 한 번의 실수에 불과하므로, 실제 비율은 몇 배 더 높을 수 있습니다. 여전히 낮은 편이지만, 소수점 이하로 표현된 만큼 정밀하지는 않습니다.
매트릭스에 새로 추가된 내용: Julia-1
Supersonic Labs는 9월 26일 Julia-1을 출시했습니다. 이는 다국어 ModernBERT 인코더를 기반으로 구축된 1억 4,400만 개의 파라미터를 가진 의사결정 모델이며, Apache-2.0 라이선스를 따릅니다. 이 모델은 노트북 CPU에서도 실행할 수 있을 만큼 작습니다. 해당 모델 카드에 따르면 Julia-1은 Supersonic 자체의 유형별 의사결정 벤치마크에서 Jev를 능가했습니다(73.2% 대 72.7%). 저희는 공식 체크포인트와 런타임을 사용하여 다른 모든 것과 정확히 동일한 테스트로 이를 실행해 보았습니다.
저희가 독립적으로 구축한 테스트 세트에서 Julia-1은 0.450을 기록했으며, 최소 90%의 확신도를 보였음에도 불구하고 답변이 틀린 경우가 30%에 달했습니다. 이 결과는 세 번 반복해도 결정론적이었고 매우 빨랐지만, 예/아니오(yes/no) 답변에서는 전혀 구분이 되지 않았습니다. 정답이 '예'일 때 평균 P(yes)는 0.36이었고, 정답이 '아니요'일 때도 0.37에 불과했습니다. 또한 이 모델은 다른 모델들과 달리 문구(wording)에 민감합니다. 명확한 환불 질문의 경우, 단순히 질문만 했을 때는 P(yes)가 0.005였으나, '예/아니요' 설명을 추가하자 0.997로 급변했습니다. 테스트 세트의 모든 예/아니오 질문에
- **재생 가능성(Replayability)**은 모델의 속성이 아니라 배포 환경의 속성입니다. Kev는 한 번에 요청 단위로, 최대 3개의 배치 단위로 비트 단위 정확하게 작동했으며, 5개 이상의 배치에서는 드리프트가 발생했습니다. 실제 운영할 부하 조건에서 결정론적(determinism) 테스트를 수행하십시오.
- 드리프트 폭이 작다면, 중요한 부분을 확인하세요. 2,598개의 배치 처리된 답변 중 상위 답변 변경은 두 번이었으며, 모두 근접한 동점 상황이었습니다. Poisson Labs가 Jev에 대해 제안했듯이, 임계값 주변의 좁은 범위를 "다시 질문하거나 사람에게 문의"하는 것으로 간주하십시오.
- 분리된 데이터셋(held-out data)에서 임계값을 설정하세요. 우리가 발표한 커버리지(coverage)는 적절하게 분할된 테스트를 통과했지만, 실제 오류율은 단일 숫자가 암시하는 것보다 더 다양합니다.
- 다른 사람의 벤치마크로 새로운 모델을 테스트하세요. Julia-1 자체의 수치와 우리의 수치는 매우 다른 이야기를 전하고 있습니다.
Taylor Kolasinski와 Poisson Labs에 다시 한번 감사드립니다. 그들의 질문 덕분에 우리는 지금까지 이 모델들에 대해 배운 것 중 가장 유용한 것을 얻었습니다. 다음 목록에는 이미지도 처리할 수 있는 오픈 Jev 호환 모델인 imajev가 있습니다.
본 기사에 대하여. 본 기사와 여기에 포함된 코드는 주로 AI(주로 Anthropic의 Claude를 사용했으며, Autom8ly의 내부 프롬프트와 스킬을 활용)에 의해 생성되었고, 제가 지휘했습니다. 모든 Kev 실행은 2026년 9월 26일과 28일에 단 하나의 NVIDIA RTX 4060 (8 GB)에서 진행되었으며, bitsandbytes를 사용하여 4비트로 로드된 Kev-4B 모델을 사용했고, 저희의 도구 중립적인 gutcheck 스코어러로 jabr/classifier-benchmark v2에 대해 점수를 매겼습니다. Julia-1은 SupersonicLabs/Julia-1의 개정판 a85b1273(가중치 SHA-256 df853bf7…)이며, CPU에서 자체 Python 런타임과 엄격한 인코딩으로 실행되었습니다. 저희는 TypeSafe, Poisson Labs, Supersonic Labs 또는 테스트된 프로젝트와 제휴 관계가 없습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기
