Kev와 Laya: TypeSafe의 Jev에 대한 오픈 소스 대안
요약
OpenAI 출신 개발자가 개발한 Jev는 텍스트와 질문을 입력받아 확률값만 반환하는 '결정 모델'입니다. 이는 LLM의 문자열 생성 및 파싱 과정 없이 병렬로 답변하며, 빠른 응답 속도와 환각 방지라는 장점을 가집니다. 이 기술은 기존 채팅 모델 대비 압도적인 성능 차이를 보여주며 개발자들의 큰 관심을 받고 있습니다.
핵심 포인트
- Jev는 텍스트 기반의 확률값만 반환하는 결정 모델입니다.
- LLM처럼 문자열을 생성하지 않아 환각이나 파싱 과정이 없습니다.
- 응답 속도가 기존 LLM 대비 압도적으로 빠릅니다 (70~500ms).
- 기술적 핵심은 상태를 한 번 인코딩하고 질문 분기를 병렬 처리하는 구조입니다.
"JSON 분류기로 1,200만 조회수라니? 그래, 우리는 거품 속에 있어." 그 트윗은 Hugging Face 관계자인 Niels Rogge가 올린 것이었다. X 플랫폼의 절반은 예/아니오 질문에 답하는 모델 때문에 정신을 못 차렸고, 나머지 절반은 아무도 신경 쓰는 것에 짜증을 냈다.
출시일은 2026년 9월 15일이었다. 2년간 은밀히 개발되었다. OpenAI 출신의 창업자가 만들었다.
가중치(weights)는 잠겨 있고, 대기자 명단 접근 권한이 주어졌다.
Jev는 한 가지 기능만 한다: 텍스트와 질문을 보내면 확률값들을 돌려받는다. 선택지, 점수, 예/아니오. 문장도 없고, 토큰도 없고, 파싱할 것도 없다.
그리고 반응은 엄청났다. HN(Hacker News) 스레드는 520개의 댓글과 함께 1,900점을 돌파했다.
그러다 더 흥미로운 일이 벌어졌다. 사람들이 직접 재구축하기 시작한 것이다.
24시간 만에 첫 번째 클론들이 나타났다. AINews는 이틀 동안 여섯 개를 기록했다.
awesome-jev 목록에는 이제 12개가 넘는 프로젝트가 추적되고 있다. 그중 가장 큰 Laya는 19,000개의 스타를 돌파했고 하루 만에 5,000개를 추가했다.
나는 GitHub를 계속 새로고침하며, 왜 JSON 분류기가 이렇게 많은 관심을 받는지 궁금해했다.
그 답은 우리가 호스팅된 AI에 대해 어떤 감정을 가지고 있는가에 대한 무언가를 말해주었다. 만약 당신이 LLM(대규모 언어 모델)에게 텍스트를 작성하게 한 후 즉시 if 문으로 파싱하는 경험을 했다면, 이 싸움은 바로 당신에 관한 것이다.
결정 모델이란 무엇인가
사람들이 항상 묻는 질문이 있다: 시스템 원(System One) 모델이란 무엇인가?
형태는 간단하다. 상태(state), 즉 어떤 텍스트든—이메일이나 JSON 문서 등—와 함께 질문을 보낸다. 각 질문은 자신의 답변 유형을 선언한다.
{
"state": "제 지급액이 세 번 실패했습니다.",
"questions": {
...
모델은 이것을 한 번 읽고 모든 것을 병렬로 답변한다. 산문(prose)이 아닌 확률값들을 반환한다.
Jev의 창업자는 OpenAI에서 ChatGPT가 된 지시어 작업(instruction work) 구축에 도움을 준 Diogo Almeida이다. 2년간 은밀히 개발되었으며, 그 핵심은 날카롭다.
Jev를 최첨단 인텔리전스 함수 호출(frontier-intelligence function call)로 생각해보라.
문자열 생성(string generation)이 없다는 것은 환각된 JSON도 없고, 파싱 과정도 없고, 수정 단계도 없다는 의미다. 모델은 환각할 수 없다. 문장도 쓸 수 없다.
입력 비용은 백만 토큰당 $0.042이며, 출력은 무료이고, 응답 시간은 70밀리초에서 500밀리초 사이에 도착한다.
프론티어 채팅 모델은 같은 작업을 수행하는 데 3초에서 329초가 걸린다. 이 격차가 핵심 이야기다.
클로즈드 웨이트는 도발이다
이러한 출시 이후에 일어날 일은 예측 가능하다. 클로즈드 웨이트와 기술 논문 부재는 숙제처럼 여겨진다.
연구원 Archer Hume은 공개 API를 조사하며 컨텍스트(context)가 늘어남에 따라 지연 시간(latency)이 어떻게 커지는지, 그리고 질문 순서를 바꾸었을 때 답변이 어떻게 변하는지를 관찰했다.
그 결과 'Jev's Architecture Unmasked'라는 내용이 나왔다. 이는 상태를 한 번 인코딩하고, 모든 질문 분기(question branch)를 병렬로 실행하며, 내부 표현(internal representations)에서 확률을 직접 읽어내는 인과적 트랜스포머(causal transformer), 아마도 희소 MoE(sparse MoE) 방식이었다. 그는 이것이 추측에 기반한 것임을 인정한다.
하지만 이는 누구나 가질 수 있는 가장 명확한 그림이었다.
그 게시물은 청사진이 되었다. 거품을 탄 사람들의 목소리는 컸다. 하지만 구축자(builders)들이 더 크게 움직였다.
kev: 정직한 드롭인 솔루션
대부분의 튜토리얼은 모델을 미세 조정(fine-tune)하라고 말한다. Kev는 다른 방법을 보여준다.
Kev는 Turborepo 개발자인 Jared Palmer로부터 나왔다. 이는 Qwen3.5와 Qwen3.8 기반으로, 공개되지 않은 아키텍처를 따르는 일련의 소형 의사결정 모델이다. Apache-2.0 라이선스이며, 노트북용 0.8B부터 데이터 센터 GPU용 27B까지 네 가지 크기로 제공된다.
가장 영리한 부분은 API다. Kev는 TypeSafe의 /v1/systemone 계약을 따르기 때문에, 사용자는 TypeSafe 자체 Python SDK를 로컬 서버에 연결하기만 하면 아무것도 변경할 필요가 없다. 이것이 바로 클로즈드 제품의 사용자들을 정중하게 확보하는 방법이다.
그리고 평가(evals) 부분. 내가 가장 존경하는 부분이다.
Kev-27B는 새로운 출처에서 Jev와 비슷한 지점에 도달한다 (0.851 대 0.857). 그리고 README에는 명확하게 적혀 있다: 이것은 통제된 비교가 아니기 때문이다. 왜냐하면 우리는 Jev가 무엇으로 학습되었는지 모르기 때문이다.
또한 Kev가 뒤처지는 부분도 나열한다. MMLU-Pro에서는 0.675로 Jev의 0.840에 비해 낮은 점수를 기록했다.
날짜 정밀 계산(day-precision date math)에서도 소형 모델들이 뒤처진다.
이러한 정직함이야말로 웨이트보다 희귀하다.
laya: 모두가 별표 친 모델
문제는 당신이 생각하는 것이 아니다. 그것은 자신감(confidence)이다.
Laya 자체 연구에 따르면, 영어 체크포인트가 크메르어(Khmer)에서 0.952의 자신감을 보고하면서도 정확도는 0.000을 기록했다. 확신하지만 완전히 틀린 모델이었다.
만약 프로덕션 코드를 기반으로 브랜치를 딴다면, 침묵하는 실패(silent failures)를 배포하게 됩니다. Laya는 포워드 패스(forward pass) 이전에 스크립트를 감지하고 다국어 체크포인트로 전환하는 라우터(router)를 통해 이를 해결합니다.
22개 알파벳을 반 밀리초도 채 걸리지 않아 처리했습니다.
Laya가 이번 흐름의 주역입니다. ModernBERT 백본에 4억 2,100만 개의 파라미터를 가지고 있으며, pip install laya 명령어로 CPU 환경에서도 구동할 수 있고, 응답 속도는 약 21~33밀리초 정도입니다.
이 모델은 Convai Innovations에서 Jev보다 3일 빠른 9월 18일에 출시되었습니다. 창립자는 자신이 핵심 아이디어를 먼저 마크스(March) 2025년 arXiv 논문으로 발표했으며, 이후 비관적으로 머무르기보다는 오픈 소스 버전을 구축했다고 말합니다.
“비관적으로 머무르는 대신, 제가 배운 모든 것을 활용하고 기존 접근 방식의 모든 아키텍처적 한계를 수정하여 완전히 개방된 수평적인 System 1 의사결정 모델 패밀리를 구축하기로 결정했습니다.”
이 역사는 실제로 논쟁의 여지가 있으며, 한 리뷰에서는 David과 Goliath 구도를 마케팅에 가깝다고 평가했습니다. 그럴 만도 합니다.
벤치마크 자체도 마찬가지입니다. Laya의 헤드라인 정확도 수치는 벤치마크가 자체적으로 학습한 분할(training split)으로 미세 조정된 체크포인트에서 나온 것입니다.
제로샷(Zero-shot) 기준으로, 기본 모델은 다수 클래스 기준선(majority-class baseline)보다 낮은 점수를 기록합니다. 즉시 사용하기보다는 미세 조정해야 하는 기반 모델입니다.
| 가중치 (Weights) | 개봉 정확도 (Out-of-box accuracy) | 가격 (Price) | |
|---|---|---|---|
| Jev | 비공개 (Closed) | 가장 높음 (Highest) | $0.042/MTok 입력 |
| ... |
일주일 동안 12개의 프로젝트
저는 모델을 복제하는 것이 연구실 전체가 필요할 거라고 생각했습니다. 그러다가 이번 주말에 이런 일이 벌어졌습니다.
인터페이스는 공개되었지만, 가중치와 데이터는 그렇지 않아 품질이 뒤처졌습니다.
SemIf는 아무것도 학습하지 않았습니다. 고정된 Qwen3.5-4B에서 답변 로짓(answer logits)을 읽어왔으며, 생성 JSON보다 5배 빠르게 21개의 결정을 내렸습니다.
NanoJev는 실시간 루프를 위한 0.6B 모델이며, ViZDoom Basic에서 Jev를 능가하며 128점 만점에 56점을 기록했습니다. jevlike는 모델 대신 트레이너(trainer)를 배포합니다.
이 흐름이 의미하는 바는 다음과 같습니다:
- 인터페이스는 주말 안에 복사할 수 있다
- 정확도는 연구 문제입니다
- 데이터가 해자(moat)이며, 아무도 그것을 오픈 소스화하지 않았다
독립적인 49개 태스크 벤치마크에서 Jev는 여전히 0.966의 매크로 정확도를 기록합니다. 가장 뛰어난 오픈 엔트리 모델은 0.704를 기록했습니다.
클론들은 속도와 가격 면에서 승리합니다. 아직 점수판이 근접하지는 않습니다.
제 머리를 망가뜨린 데모
제가 계속 지켜볼 수 없었던 부분은 Flappy Bird였습니다. Laya가 이 게임을 실시간으로 플레이하며, 초당 약 30번의 결정을 내리는데, 자신에게 '새는 어디에 있니?'라는 질문만 던집니다.
어느 방향으로 움직일지 물었을 때, 모든 체크포인트가 역방향으로 답했습니다. 새가 어디 있는지 물었을 때는 깔끔하게 점수를 매긴 답변이었습니다.
P(아래) 값이 0.95, 0.82, 0.06입니다. 게임은 확률이 절반을 넘어서면 날갯짓합니다.
테트리스에서도 같은 이야기였습니다. 분당 1,799개의 결정, 52줄 클리어, 상단 도달 실패는 없었습니다.
결국에는 지게 됩니다. 조각들이 더 빨리 떨어지고 생명은 약 2분밖에 지속되지 않기 때문입니다. 그리고 그것은 숫자를 전혀 읽을 수 없습니다.
두 개의 고도를 주고도 어떤 체크포인트도 어느 쪽이 낮은지 말할 수 없습니다. 계산은 코드에서 하고, 모델에게 결론을 단어로 전달합니다.
이것이 이 장르 전체에서 가장 이상한 부분입니다. 질문 자체가 기술(craft)인 것입니다.
다시 문장으로 바꾸면 정확도가 30포인트씩 변동합니다. 저는 확률의 움직임을 보기 위해 프롬프트를 재구성하는 데 저녁 시간을 보냈습니다.
제 파트너가 제가 이것을 하는 것을 보고 이게 일인지 물었습니다. 저는 '네'라고 대답했고, 저 자신도 확신하지 못했습니다.
실제로 누가 이것을 실행해야 할까
대부분의 사람들은 이번 주에 의사결정 모델을 운영해서는 안 됩니다.
오픈 대체재들이 가격, 지연 시간(latency), 그리고 제어 측면에서 승리합니다. 정확도는 아닙니다. 아직은요.
만약 하루에 1,000개의 티켓을 처리하고 있는데 공급업체가 가격을 두 배로 올린다면, Laya나 Kev가 당신의 보험이 되어줄 것입니다.
하루에 50개의 티켓만 처리한다면, 폴더와 if 문을 사용하세요. 진심입니다. 받은 편지함용으로 4GB 모델은 과잉 사양입니다.
당신은 주말 시간을 들여 배선 작업(wiring) 비용을 지불하게 될 것입니다.
만약 하나를 선택한다면, 파인튜닝할 계획을 세우세요. Laya의 기본 체크포인트는 이것 없이는 우연에 가까운 점수를 기록합니다.
Kev 자체 문서에는 어느 부분에서 약한지 나와 있으니, 임계값(threshold)을 신뢰하기 전에 그것들을 읽어보세요. 그리고 저렴한 아이러니가 있습니다: Jev는 비싸지 않습니다.
백만 토큰당 $0.042는 기본적으로 아무것도 아닙니다. 무료라는 것은 개인 정보 보호와 제어 측면에서 이득이지, 당신의 청구서 상의 이득은 아닙니다.
진짜 핵심은 이겁니다: 모델 자체가 해자(moat)가 아닙니다. 여러분의 데이터가 포함된 평가 세트(eval set)가 해자입니다.
저는 계속해서 캄보디아 숫자(Khmer number)를 떠올립니다. 정확도(accuracy) 0.000, 신뢰도(confidence) 0.952. 아무도 단어의 의미를 확인하지 않았기 때문에 확신하면서도 치명적으로 틀린 모델 말입니다.
오픈 소스 물결이 중요한 이유는 검증이 가능하게 만들기 때문입니다. 감사할 수 있는 가중치(weights). 읽을 수 있는 데이터 세트(datasets)가 생깁니다.
다른 사람이 재실행해 볼 수 있는 평가(Evals) 말이죠. Kev와 Laya는 아직 Jev보다 낫지 않으며, 그들이 스스로 그렇게 이야기해 줄 것이고, 그것이 바로 핵심입니다.
저는 여전히 누가 이 아이디어를 발명했는지 모르겠습니다. 하지만 저는 누가 자신의 작업을 제가 검증할 수 있게 해주는지는 압니다. 그리고 저는 그 사람과 함께 구축하고 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기