Jev의 메모: 판단을 반환하는 AI 개요와 사용법
요약
Jev는 문의 분류, 태그 지정, 검색 결과 사용 여부 등 작은 판단을 구조화된 선택지나 확률로 반환하는 AI 모델입니다. 이는 일반적인 LLM의 JSON 출력 방식과 달리, 예측의 집합에 대한 속성을 제공하여 신뢰도를 높이고 복잡한 워크플로우를 개별 판단으로 분해 처리할 수 있게 합니다.
핵심 포인트
- Jev는 선택지나 점수, 확률 등 구조화된 형태로 답변을 반환합니다.
- 기존 LLM의 JSON 출력보다 예측 집합에 대한 속성을 제공하는 것이 특징입니다.
- 문의 분류, 긴급도 판정 등 복잡한 판단을 개별적으로 분해하여 처리할 수 있습니다.
- Recruitly와 같은 실제 서비스에서 도입되어 활용되고 있습니다.
문의 담당 부서를 결정하거나, 문서에 태그를 붙이거나, 검색 결과를 답변에 사용해도 되는지 판정합니다.
이러한 작은 판단들을 소프트웨어에 구현하기 위한 모델이 Jev입니다.
TypeSafe AI가 2026년 9월 15일에 얼리 액세스로 공개했습니다.
자연어로 질문할 수 있지만, 답변으로 반환되는 것은 선택지나 점수, 확률입니다.
Jev에 전달하는 것과 돌아오는 것
예를 들어, '이중 청구되었으니 환불해 주세요'라는 문의를 청구 담당 부서로 보내는 상황을 가정해 봅시다.
Jev에는 문의 문장을 state로, 담당 부서를 선택하는 질문을 questions로 전달합니다.
부서 후보는 개발자가 미리 정의합니다.
Jev가 반환하는 것은 그 후보들 중에서 선택된 부서와 각 후보의 확률입니다.
앱 측에서는 이 결과를 사용해 큐(queue)에 분류하거나, 판단이 모호하면 사람에게 인계할 수 있습니다.
질문에는 다음 세 종류가 있습니다.
| 종류 | 질문 예시 | 주요 출력 |
|---|---|---|
| Choice | 어느 부서가 대응하는지 | 선택지, 각 후보의 확률, confidence |
| Score | 얼마나 긴급한지 | 정의된 단계에 따른 점수, 각 단계의 확률, confidence |
| Noul | 환불을 요청하고 있는지 | '예'의 확률을 나타내는 noul (0~1) |
Score는 '보통', '조속 대응', '즉시 대응'처럼 평가 단계의 의미를 정의하여 사용합니다.
점수는 단계 사이의 값을 가질 수도 있습니다.
Noul의 0.5는 '예'와 '아니오'의 확률이 같다는 의미일 뿐, 긴급도가 중간 정도라는 의미는 아닙니다.
출처: Introduction, Primitives (Questions)
기존 LLM과 무엇이 다른가
같은 문의 분류는 기존 LLM에도 요청할 수 있습니다.
예를 들어 'billing, technical, other 중 어느 것인지를 JSON으로 반환하도록' 지정하고, 앱 측에서 결과를 읽어들이는 방법입니다.
구조화 출력을 사용하면 선택지나 JSON의 형태도 제약할 수 있습니다.
따라서 정해진 형식으로 반환할 수 있다는 것 자체가 Jev만의 특징은 아닙니다.
Jev는 분류 결과를 문장으로 생성하는 대신, 최
정제된 모델이라면, 확률 0.8
으로 예측한 다수의 사례에서 대응하는 결과가 약 80%의 비율로 발생할 것을 기대할 수 있습니다.
이것은 예측의 집합에 대한 속성일 뿐이며, 개별 판단이 정확함을 보장하지는 않습니다.
질문은 하나씩 좁게 정의하고, 여러 판단을 조합하는 처리는 코드에 구현합니다.
예를 들어, '이 문의를 어떻게 처리해야 하는가'라고 한꺼번에 묻기보다는, 부서, 긴급성, 환불 요청을 개별적으로 판정하고, 그 결과로부터 처리를 결정하는 구조입니다.
속도와 비용
TypeSafe가 공개한 응답 시간은 70~500ms입니다.
측정은 주로 미국 서부 해안에서 이루어졌다고 설명하며, 한국에서의 통신이나 입력 길이까지 포함한 시간은 실제 측정이 필요합니다.
동사는 자체 워크플로우 평가에서 '193.6배 빠름', '444.6배 저렴함'이라는 비교도 공개했습니다.
다만, 참고 답변에는 다른 대형 모델의 예측을 사용했고, 워크플로우 역시 동사 팀이 작성했습니다.
이러한 배율을 자신의 용도에서의 정답률이나 개선 폭으로 간주할 수는 없습니다.
직접 판매 API의 모델과 요금은 다음과 같습니다.
| 항목 | 2026년 9월 30일 기준 |
|---|---|
| 안정판 | jev-1.13.0 |
| ... |
공개된 활용 사례
Recruitly의 실제 도입
채용 업무용 CRM인 Recruitly는 Jev를 제품 내에서 사용하고 있다고 보고했습니다.
활용 분야로는 영업 이메일에 대한 답변 분류, 문의 긴급도 판정, 에이전트 조작의 위험성 확인, 검색한 자료가 질문에 답하고 있는지 판정 등이 있습니다.
동사는 확신도가 낮은 경우나 Jev를 이용할 수 없을 때 기존 LLM으로 처리를 되돌리는 구조를 채택했습니다.
이는 도입 기업 자체의 보고이며, 본 기사에서는 실제 운영상의 정확도나 효과를 검증하지 않았습니다.
Baader의 사내 문서 분류
Baader는 사내 마케팅 관련 문서 275건을 문서 종류나 대상 독자 등으로 분류했습니다.
동사의 측정에 따르면 전체 처리 시간은 30초, 입력 비용은 약 0.11달러였습니다.
비교 대상의 기존 태그도 AI가 생성했기 때문에, 보고서에는 생략되었습니다.
返ってきた値を使って、担当キューの選択や人への引き継ぎを実装します。
返金の実行などの操作は、アプリ側の権限確認や業務ルールを通して行います。
HTTP で直接呼ぶ場合のエンドポイントは POST https://api.typesafe.ai/v1/systemone です。
출처: TypeSafe Python SDK, 동기 클라이언트 사양, API reference
도입 전에 남겨둘 주의사항
타입의 보장과 판단의 정확성
공식 웹사이트의 'Zero Hallucinations'는 정의된 출력 범위와 타입을 지킨다는 성질로 읽어야 합니다.
후보에 포함되지 않는 부서를 반환하는 문제는 막을 수 있지만, 후보 중에서 잘못된 부서를 선택할 가능성은 남아 있습니다.
공식적으로도 모델의 실패 사례가 공개되어 있습니다.
출처: 공식 발표의 타입 안전성 설명, Jev 1.13 jaggedness
confidence와 확률
Choice와 Score의 confidence는 반환된 확률 분포가 얼마나 집중되어 있는지를 하나의 수치로 요약한 지표입니다.
confidence = 0.9를 '이 판단은 90%의 확률로 옳다'라고 해석할 수는 없습니다.
Noul에는 별도의 confidence는 없고, '예'일 확률이 반환됩니다.
자동 처리 임계값은 실제 입력에 정답 레이블을 붙여 평가하고, 오판정의 영향을 고려하여 결정합니다.
모델 업데이트로도 결과가 바뀔 수 있으므로, 임계값을 조정한 실전 환경에서는 jev-1.13.0처럼 버전을 고정하고, 업데이트 시 재평가하는 방법이 사용될 수 있습니다.
출처: Confidence, Models
현행 모델의 입력과 강점/약점
- 일본어: 입력은 받지만, 영어보다 정확도가 떨어진다고 공식적으로 설명되어 있습니다. 일본어 실데이터로 평가가 필요합니다. - 이미지나 음성: 직접적인 입력에는 대응하지 않습니다. OCR이나 문자 변환 등으로 텍스트화하는 처리가 필요합니다. - 계산이나 날짜 비교: 정확한 산술이나 건수 집계는 코드로 진행합니다. - 복잡한 추론: 다단계의 추론을 하나의 질문에 담지 말고, 판단을 나누거나 다른 모델을 사용합니다. - 공격적인 입력: 프롬프트 인젝션(Prompt Injection) 등에 의해 답변이 변동할 가능성이 있다고 공식적으로 명시하고 있습니다.
자신의 앱에서 시도해 본다면
문의 분류나 검색 자료의 선별은 판정 결과만을 기록하는 검증부터 시작할 수 있습니다.
이미 LLM으로 분류시키고 있는 처리가 있다면, 동일한 입력으로 Jev의 결과를 기록하여 정답률, 처리 시간, 비용을 비교할 수 있습니다.
판단이 모호한 건을 얼마나 사람에게 되돌릴지까지 측정하면, 자동화할 수 있는 범위를 결정할 수 있습니다.
참고 자료
Discussion

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기