TypeSafe AI의 Jev: 화제성, 반응, 그리고 2주 만에 등장한 클론 전쟁
요약
TypeSafe AI가 발표한 Jev는 텍스트 생성을 하지 않고, 사용자의 프로그램 상태와 질문을 기반으로 확률값(0~1)만 반환하는 새로운 유형의 모델입니다. 이는 기존 LLM이 토큰 단위로 순차적으로 출력되는 방식과 달리, 병렬 샘플링 방식을 사용하여 속도와 신뢰도를 높인 것이 특징입니다. Jev는 자유 형식 텍스트 대신 '결정(verdicts)'만 출력하도록 설계되어, 시스템 통합 및 자동화에 최적화된 개발 도구로 주목받고 있습니다.
핵심 포인트
- Jev는 텍스트 생성 없이 확률값만 반환하는 결정 모델입니다.
- 병렬 샘플링 방식을 사용하여 속도와 신뢰도를 극대화했습니다.
- RLCDF를 통해 정직한 확률에 최적화되어 시스템 통합에 유리합니다.
어느 역할극 커뮤니티에서 사람들이 자신의 채팅 답변을 산업 자동화용으로 구축된 모델에 입력하고 있습니다. 이 모델은 그들의 글쓰기에 점수를 매기고 어떤 답변이 캐릭터에 더 잘 맞는다고 알려줍니다. 이 모델이 바로 Jev이며, 이는 TypeSafe AI가 보도 자료에서 발표한 내용과는 다릅니다.
저는 새벽 1시에 역할극 스레드 제목들을 스크롤하다가 이것을 발견했습니다. Jev는 2026년 9월 15일에 비공개 상태(stealth)를 벗고 공개되었습니다. TypeSafe AI는 ChatGPT의 지침 따르기 작업에 참여했던 Diogo Almeida가 설립했습니다.
핵심 아이디어는 간단합니다. Jev는 절대 텍스트를 작성하지 않습니다. 사용자가 프로그램 상태(program state)를 보내고, 타이핑된 질문을 하면, 70밀리초에서 500밀리초 사이에 확률값들을 받게 됩니다. 출력 토큰 비용은 전혀 들지 않습니다.
반응은 익숙한 방식으로 나뉘었습니다. r/LocalLLaMA에서는 330개의 댓글이 이 기술을 '새로운 옷을 입은 구식 기술'이라고 비난했습니다. r/BetterOffline의 한 사용자는 이를 더 간단하게 표현했습니다:
Jev는 Jian Yang의 Hotdog / Not Hotdog 앱이다.
이는 실리콘밸리의 농담이었고, 성공적으로 먹혔습니다.
그리고 이상한 부분이 있었습니다. 가장 활발했던 스레드는 역할극 도구인 r/SillyTavernAI와 스타트업 아이디어를 점수 매기는 r/SideProject였습니다. 2주 후, OpenAI는 Luna를 기반으로 Decisions API를 출시했고, AWS는 Strands Decider 2B라는 로컬 모델을 출시했습니다.
TechCrunch는
noul: 예/아니오 질문에 대한 답으로 0에서 1 사이의 확률을 반환합니다.choice: 고정된 목록 중에서 선택하며, 각 옵션은 확률을 받습니다.score: 입력값을 수치적 척도나 루브릭에 따라 평가합니다.
이것이 전체 API 사양입니다.
여기에 자유 형식의 텍스트는 없습니다.
저는 Jev가 언급되는 것을 계속 보았고, 채팅 모델이라고 가정했습니다. r/PromptEngineering 스레드에서도 같은 내용이 나왔으며, 상위 댓글은 게시자가 광고한다고 비난했습니다. 혼란스러워하는 것은 당연합니다. 우리는 판결(verdicts)만 출력하는 모델에 익숙하지 않습니다.
엔드포인트는 단 하나의 라인입니다: api.typesafe.ai/v1/systemone.
200밀리초가 중요한 이유
실제 일어나는 일은 Jev가 토큰 생성을 건너뛴다는 것입니다. 일반적인 모델들은 마지막 토큰에 조건화되어 한 번에 하나의 토큰을 방출합니다. Jev는 하드웨어 인식 방식으로 모든 답변을 한 번에, 병렬로 샘플링합니다. 속도가 나오는 곳이 바로 여기입니다.
학습 방식도 다릅니다. RLHF(Reinforcement Learning from Human Feedback)는 인간 평가자가 선호하는 것에 최적화됩니다. RLCD는 Calibrated Decisions를 위한 강화 학습(RL)의 약자로, 정직한 확률에 최적화됩니다. 높은 신뢰도는 높은 정확도를 의미하며, 모델은 숫자를 믿을 수 있도록 구축되었습니다.
이것은 속도보다 더 중요합니다. 만약 모델이 95%의 시간 동안 작업을 수행할 수는 있지만, 실패하는 5%일 때 언제인지 말할 수 없다면, 그것을 어떤 시스템에도 연결할 수 없습니다.
| | Jev | 채팅 LLM |
| :--- | :--- |
| 출력 | 유형화된 결정 (typed decisions) | 자유 형식의 텍스트 (free text) |
| ... |
회의론자들이 지적하는 바가 맞다
r/LocalLLaMA에서 가장 큰 주장은 Jev가 새롭지 않다는 것입니다. 보정된 확률을 가진 분류기는 이미 해결된 문제입니다. TypeSafe는 흥미로운 주장을 검증하기에 충분한 아키텍처 세부 정보를 공개하지 않았습니다.
제가 틀릴 수도 있지만, 아키텍처의 침묵은 가격보다 저를 더 괴롭힙니다. 회사 자체도 가격 책정이 보조금을 받는 것이 아니라고 증명할 수 없다고 인정했습니다.
입력 토큰 비용은 백만 개당 $0.042입니다. 출력 토큰은 무료입니다. 이 가격은 사실이 아니라 베팅입니다.
Jev 역시 문서화된 격차가 있습니다. 특정 분야에 대한 깊은 지식이 부족합니다. 사용자가 컨텍스트를 공급해야 하므로, 어느 정도 작업의 일부를 직접 해야 합니다. 이는 라우팅(routing)에는 괜찮지만, 전문가적 판단(expert judgment)에는 적합하지 않습니다.
아무도 예상치 못한 반응
저는 모델이 의미 있으려면 수년이 필요하다고 생각했습니다. 그런데 Jev가 2주 만에 클론되었습니다.
OpenAI는 DevDay를 앞두고 작은 Luna 모델을 기반으로 Decisions API를 발표했으며, 호출당 약 150밀리초가 소요됩니다. AWS는 로컬에서 실행하기에 충분히 작은 Strands Decider 2B를 출시했습니다. 거대 기업 두 곳이 2주 만에 같은 아이디어에 대한 두 가지 접근 방식을 제시한 것입니다.
가장 이상한 채택 사례는 역할극(roleplay) 분야입니다. 사람들은 Jev를 SillyTavern에 연결하여 답변의 점수를 매기도록 했습니다. 평균 응답 시간은 약 200밀리초이며, 호출당 대략 $0.0005가 소요됩니다. 제가 본 기계 기반 모델 중 가장 인간적인 사용 사례입니다.
그리고 개발자들은 더 나아갔습니다. Jev를 기반으로 하는 Claude Code 메모리 도구링이 있습니다. 130개의 댓글을 가진 아이디어 점수화 사이드 프로젝트도 있습니다. Cloudflare Workers에서 이를 실행하고 있습니다. 모두가 자신이 이미 만든 것에 판정 기계(verdict machine)를 부착하고 있습니다.
명명법에 대한 짧은 우회
이 모든 것은 한 권의 책으로 거슬러 올라갑니다. Jev는 Daniel Kahneman의 저서 『생각에 관한 생각 (Thinking, Fast and Slow)』에 나오는 빠르고 직관적인 사고 방식인 시스템 1(System 1)에서 이름을 따왔습니다.
AI 주기마다 누군가 그 책을 재발견하고 제품에 그 이름을 붙입니다. 우리는 수년간의 시스템 2(System 2) 추론 마케팅을 견뎌냈고, 이제 진자추는 시스템 1로 기울고 있습니다.
저도 같은 일을 합니다. 제 홈 디렉토리에는
일반적인 분류기(classifier)도 괜찮습니다. 레이블이 자주 바뀌지 않는 한 말이죠. 보정된 확률(calibrated probabilities)은 대량의 트래픽에서만 중요합니다. 여기서 침묵하는 오답 하나가 실제 돈을 잃게 만들기 때문입니다.
그리고 이것은 도박과 같습니다. 가격 책정이 지원받는 것처럼 보이고, 회사도 그렇게 말하고 있습니다. 아키텍처(architecture)는 충분히 공개되지 않았습니다.
클론들은 이미 여기에 와 있고, 의사 결정 모델(decision model)은 최첨단 모델(frontier model)보다 복제하기가 쉽습니다. 만약 OpenAI와 AWS의 버전이 좋다면, 해자(moat)는 얇을 것입니다.
'환각할 수 없다(cannot hallucinate)'라는 것도 들리는 것보다 범위가 좁습니다. Jev는 타이핑할 수 없기 때문에 말도 안 되는 것을 타이핑할 수는 없습니다. 하지만 여전히 잘못된 결정을 내릴 수 있고, 자신감 있게 그렇게 할 것이며, 당신의 파이프라인은 그것을 신뢰하게 될 것입니다.
마지막 생각
저는 역할극(roleplay)하는 사람들에 대해 계속 생각합니다. 거래를 라우팅하고 가드레일 에이전트(guardrail agents) 역할을 하도록 구축된 모델 말입니다.
상상할 수 있는 가장 지루한 엔터프라이즈 도구이지만, 가장 빠르게 채택한 커뮤니티는 서로의 픽션(fiction)을 평가하던 사람들이었습니다.
그것이 아무도 예측하지 못한 부분입니다. 기업들이 보정된 확률을 신뢰하는 데는 수년이 걸릴 것입니다. 인터넷의 이상한 구석진 곳들이 그것을 연결하고 상용화했습니다.
보통은 반대인 경우가 많습니다.
그래서 제가 계속 맴도는 질문이 있습니다. 모델이 말을 멈출 때, 당신은 무엇을 다르게 구축하게 될까요?
그리고 더 날카로운 질문: 애초에 채팅(chat)으로 무엇을 사용하고 있었나요?
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기