TypeSafe의 Jev AI: 의사결정 모델이 LLM보다 더 잘하는 것과 할 수 없는 것
요약
TypeSafe AI가 출시한 Jev는 텍스트 생성 대신 상태와 스키마를 읽고 타입이 지정된 답변을 반환하는 의사결정 모델입니다. 이는 LLM의 토큰 기반 구조화 방식과 달리, 전 요청을 한 번에 처리하여 비용 효율성과 속도를 극대화합니다. Choice, Score, Noul 세 가지 기본 요소를 통해 분류 및 판단 작업을 수행하며, 특히 에이전트 오케스트레이션에서 라우팅 결정 등 고비용 모델 사용을 줄이는 데 유용합니다.
핵심 포인트
- Jev는 텍스트 생성 없이 상태와 스키마를 읽고 타입 지정 답변을 반환하는 의사결정 모델입니다.
- LLM의 토큰 단위 구조화 방식과 달리, Jev는 전 요청을 한 번에 처리하여 효율적입니다.
- Choice, Score, Noul 세 가지 기본 요소를 통해 분류 및 판단 작업을 수행합니다.
- AI 에이전트 오케스트레이션에서 라우팅 결정 등 고비용 모델 사용을 줄이는 데 활용됩니다.
실제 운영 환경에서 접하는 대부분의 'AI' 호출은 대화가 아닙니다. 그것들은 결정입니다. 이 티켓을 어떤 큐에 넣어야 하는지, 이 행동이 안전한지, 이 리드가 얼마나 긴급한지 같은 것입니다. 하지만 우리는 여전히 이를 생성형 LLM(Large Language Model)으로 보내고, 때로는 장황한 서문이나 지어낸 필드와 함께 도착하는 JSON을 파싱합니다.
TypeSafe AI가 2026년 9월 15일에 출시한 Jev는 다른 경로를 따릅니다. 이 모델은 텍스트를 전혀 작성할 수 없습니다. 대신 상태(state)와 스키마(schema)를 읽고, 70ms에서 500ms 사이에 보정된 확률을 가진 타입이 지정된 답변을 반환합니다. 작동 방식과 비용 절감 지점, 그리고 한계점을 설명합니다.
의사결정이 생성(Generation)가 필요 없는 이유
제한적 디코딩(constrained decoding)을 사용하더라도 LLM은 토큰 단위로 구조화된 답변을 만듭니다. 60개의 토큰으로 이루어진 JSON 라우팅 결정은 모델을 통과하는 60번의 순차적인 과정을 의미합니다. 그리고 이 모델이 노출하는 logprobs는 다음 토큰이 얼마나 가능성이 높은지를 설명할 뿐, 그 결정 자체가 정확할 확률을 나타내지는 않습니다.
Jev는 프리필(prefill)-전용 모델입니다. 전체 요청이 트랜스포머(transformer)를 한 번 통과하며, 전문화된 헤드(specialized heads)가 옵션들을 병렬로 점수 매깁니다. 이 모델은 TypeSafe가 RLCD라고 부르는 방식으로 훈련되었는데, 이는 인간이 좋아하는 답변에 보상하는 대신 잘못 보정된 확률에 페널티를 부여합니다. 그 결과, 동일한 상태에 대해 열 가지 질문을 하는 비용이 단 한 번의 질문을 하는 비용보다 거의 더 비싸지 않습니다.
세 가지 기본 요소(Three primitives)
- Choice: 주어진 집합에서 하나의 레이블을 선택합니다. 승자, 전체 확률 맵(probability map), 그리고 신뢰도 값(confidence value)을 반환합니다.
- Score: 심각성이나 좌절감과 같은 순서가 있는 루브릭(rubric)에 무언가를 배치합니다. 점수, 확률, 그리고 신뢰도를 반환합니다.
- Noul: 주어진 진술이 참인지 확인합니다. 별도의 신뢰도 없이 0과 1 사이의 하나의 확률을 반환하는데, 이는 그 확률 자체가 확실성(certainty)이기 때문입니다.
입력 토큰당 비용은 백만 개당 $0.042이며, 출력 토큰은 무료입니다.
정말로 40~400배 저렴할까요?
TypeSafe는 다양한 시장을 공략하므로 테스트해 보겠습니다. 한 달에 100만 건의 분류 작업을 가정하고, 각 입력은 약 400 토큰, 출력은 50 토큰이 필요하다고 할 때 Jev 비용은 대략 $16.80입니다. 미니급 LLM은 약 $90이고, 프론티어 모델(frontier model)은 약 $1,950입니다.
이는 프론티어 모델보다 116배 저렴하지만, 소형 모델(small one)보다는 겨우 5.4배 저렴합니다. 대부분의 팀들은 이미 고용량/저맥락 작업(high-volume, low-context tasks)을 소형 모델로 처리하고 있으므로, 현실적인 절감액은 두 번째 수치에 가깝습니다. 또한 TypeSafe의 속도 주장은 내부 벤치마크에서 나온 것이며 편향될 수 있음을 인정한다는 점에 유의하세요.
적용 분야 (Where it fits)
• 에이전트 실행 전 라우팅(Routing before an agent runs). 문서를 질문하면 검색(search)으로, 숫자 데이터는 SQL로, 창의적인 내용은 LLM으로 150ms 이내에 보낼 수 있습니다. 이는 고비용 모델을 루프에서 제외시키며 자연스러운 AI 에이전트 오케스트레이션(AI agent orchestration) 빌딩 블록이 됩니다 [https://intercode.com/services/ai-agent-orchestration].
• 안전 게이트(Safety gates). Noul에게 제안된 명령이 데이터를 유출하거나 자격 증명(credentials)을 누설할 수 있는지 물어보고, 0.15와 같은 임계값 이상일 경우 차단할 수 있습니다.
• 출력 가드레일(Output guardrails). 두 번째 LLM 판정자 없이 생성된 텍스트에서 PII(개인 식별 정보), 비밀 정보(secrets) 및 어조를 확인할 수 있습니다.
• 티켓 분류(Ticket triage). 부서, 좌절 수준(frustration level), 경영진 긴급성(executive urgency)을 단 한 번의 호출로 얻을 수 있습니다.
• 리드 점수화(Lead scoring). 회사 규모, 구매자 권한(buyer authority), 긴급성을 개별적으로 점수화한 다음, 계수(coefficients)를 사용하여 코드로 결합할 수 있습니다. 비즈니스 우선순위가 프롬프트 재작성 없이 변경되므로, 이는 AI 자동화(AI automation) 워크플로우에 적합합니다 [https://intercode.com/services/ai-automation].
• RAG 필터링 및 리랭킹(RAG filtering and reranking). 검색된 20개의 청크를 병렬로 스크리닝할 수 있습니다. TypeSafe 자체 법률 검색 벤치마크에서, 리랭킹은 Top-1 정밀도를 5%에서 18%로, Top-10을 38%에서 62%로 끌어올렸습니다.
한계점 (Where it breaks)
TypeSafe는 9가지 실패 모드를 문서화했습니다. 가장 중요한 것들은 다음과 같습니다:
• 문자 그대로의 읽기(Literal reading). 명시되지 않은 함의(implications)는 보이지 않으므로, 기준에 예외 사례(edge cases)를 구체적으로 명시해야 합니다.
• 산술, 개수 또는 날짜 논리 부재. 수학 계산은 코드로 수행하세요. 개수를 셀 때는 항목별로 예/아니오 질문을 하고 소프트웨어에서 집계해야 합니다.
• 다단계 관계 (Multi-hop relations). 중첩된 권한이나 관계를 코드에서 평탄화(flatten)하여 전송하세요.
• 희석된 컨텍스트 (Diluted context). 관련 없는 서술이 가득 찬 거대한 상태는 의사결정을 저하시키므로, 관련 청크만 전송하세요.
• 프롬프트 주입 (Prompt injection). 상태 내의 악성 텍스트가 지침을 무시할 수 있으므로, 입력을 정제(sanitize)하세요.
• 옵션 순서 (Option order). 선택지를 재배열하면 확률이 변동될 수 있습니다. 옵션을 결정론적으로 정렬하세요.
• 생성 없음 (No generation). 설명이 필요하다면, LLM을 사용하세요.
작동하는 패턴: 코드에서 결정론적 전처리(deterministic prep)를 수행하고, 중간에 의사결정 모델을 배치하며, 그 위에 신뢰도 임계값(confidence thresholds)을 설정하는 것입니다. 예를 들어, 0.85 이상일 때는 실행하고, 0.50과 0.85 사이일 때는 생성형 모델로 폴백(fall back)하며, 그보다 낮은 것은 인간 검토에 보냅니다.
몇 주 사이에 등장한 대안들
• Cloudflare Clef 및 Clef-flash (10월 1일): Apache 2.0 기반의 오픈 웨이트 모델로, Jev와 동일한 API 형태를 가지며 최대 네 개의 이미지를 지원합니다. Clef-flash는 Workers AI에서 중앙값 약 39ms를 보고했습니다. 이 모델이 Jev보다 우수하다는 벤치마크 결과는 자체 보고된 것입니다.
• Convai Laya (9월 22일경): 오픈 소스이며, 매개변수가 약 4억 2,100만 개이고 GPU 없이도 RAM 1GB 내외에서 구동 가능하며 지연 시간은 9~33ms입니다.
• OpenAI Decisions API (9월 29일 발표): 10월 초 기준으로 공개 문서나 가격 책정 정보가 없습니다. 한 독립적인 테스트에서는 표준 키를 사용했을 때 403 오류가 보고되었고, 구조화된 출력을 시뮬레이션했을 때 중앙값 약 1.46초였습니다. 이는 OpenAI가 주장하는 150ms와 비교됩니다.
비평가들은 DeBERTa나 SetFit 같은 분류기(classifiers)가 이미 존재했으며, 고정 레이블을 가진 안정적이고 대용량의 작업에는 여전히 파인튜닝된 작은 인코더가 더 저렴하고 정확하다고 지적합니다. 새로워진 점은 훈련 파이프라인 없이 제로샷(zero-shot), 타입 지정(typed), 보정된 API라는 것입니다.
요약 (Takeaway)
분류(classification), 라우팅(routing), 점수 산정(scoring) 및 정책 검사(policy checks)를 대량으로 처리할 때, 의사결정 모델은 지연 시간(latency)과 비용을 절감할 수 있습니다. 텍스트가 필요하거나, 다단계 추론(multi-step reasoning) 또는 설명이 필요한 경우에는 LLM을 유지하세요. 진정한 엔지니어링 작업은 그것 주변의 연결 구조입니다: 신뢰도 게이트(confidence gates), 폴백(fallbacks) 및 결정론적 전처리(deterministic preprocessing). 바로 이곳에 기존 스택에 견고하게 AI 통합하는 것이 효과를 발휘합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기