Jev가 더 나은 에이전트 평가 도구가 될 수 있을까?
요약
TypeSafe AI가 출시한 Jev는 텍스트 생성 대신 유형화된 답변을 반환하는 새로운 에이전트 평가 도구입니다. 이는 기존의 코드 기반 또는 LLM 심사관 방식의 한계를 극복하며, 높은 일관성, 속도, 저렴함을 자랑합니다. System One 모델로 불리는 Jev는 에이전트 엔지니어링에 새로운 방향을 제시할 것으로 기대됩니다.
핵심 포인트
- Jev는 텍스트 생성 대신 유형화된 답변을 반환하는 'System One' 모델입니다.
- 기존 평가 방식(코드 기반/LLM-as-judge)의 한계를 극복합니다.
- 높은 일관성, 빠른 추론 속도, 낮은 비용을 동시에 제공합니다.
- 에이전트 엔지니어링 분야에 새로운 평가 패러다임을 제시할 것입니다.
핵심 요약
Jev는 근본적으로 다른 종류의 평가 도구입니다. LLM처럼 텍스트를 생성하는 대신, 직접 유형화된(typed) 답변을 반환합니다.
Jev는 연속적인 점수 측정에서 현저하게 더 일관적이었습니다. Jev의 품질 점수 분산은 GPT-5.6 Luna, Terra, Claude Sonnet 4.6보다 92–913배 낮았습니다.
Jev는 또한 가장 빠르고 저렴했습니다. 평균 0.44초에 $0.00035/호출(Claude의 경우 총 $28.17 대비 $0.34)였습니다.
결과는 유망하지만, 아직 초기 단계입니다. 하지만 이것이 제한적인 테스트임에도 불구하고, Jev의 성능은 에이전트 평가 도구에 대한 흥미로운 새로운 방향을 제시합니다.
오늘날 에이전트 평가는 두 가지 유형으로 나뉩니다: 코드 기반(code-based)과 LLM-as-judge입니다. 둘 다 자체적인 한계를 가지고 있습니다. 코드 기반 평가 도구는 고정된 입력에 대해 제한된 문제 세트에만 사용될 수 있는 반면, LLM 심사관은 느리고 비싸며 신뢰성이 떨어질 수 있습니다. TypeSafe AI의 Jev가 인기리에 출시됨에 따라, 우리는 'System One' 모델이 에이전트 평가 도구의 새로운 제3의 형태일지, 그리고 이것이 에이전트 엔지니어링에 어떤 영향을 미칠 수 있는지 알아보고자 했습니다.
Jev란 무엇인가?
Jev는 TypeSafe AI에서 출시한 새로운 모델입니다. Jev는 실제로는 전통적인 LLM이 아니며 텍스트를 생성하지 않습니다. 이는 TypeSafe AI 팀이 'System One' 모델이라고 부르는 것입니다:
📖 System One 모델은 소프트웨어가 직접 사용할 수 있도록 빠르고 구조화된 결정을 내리도록 구축된 일련의 AI 모델입니다. System One 모델은 상태(state)를 평가하고 유형화된 답변과 확률을 반환합니다.

TypeSafe AI에 따르면, 이로 인해 Jev는 분류 작업에서 비교 가능한 LLM보다 최대 200배 빠른 추론 속도와 400배 낮은 비용을 자랑합니다.
Jev를 사용하여 에이전트를 구축하는 방법에 대해 더 알고 싶다면, 9월 22일 화요일에 TypeSafe AI 팀과 함께 라이브 스트리밍을 개최합니다:https://events.langchain.com/webinar/building-a-harness-with-jev/
Jev가 좋은 에이전트 평가 도구가 될 수 있는 이유는 무엇인가?
오늘날의 에이전트 평가는 코드 기반이거나 LLM 심사관 중 하나이며, 각각 자체적인 장점, 한계 및 트레이드오프를 가지고 있습니다.
코드 기반 평가는 코드가 존재한 이래로 있어 왔습니다. 저렴하고 빠르며 신뢰성이 높지만, 주된 단점은 그 능력의 범위가 좁다는 것입니다. 전통적인 함수는 결정론적(deterministic) 입력이 필요하기 때문에, 에이전트 행동의 확률적(stochastic) 세계를 평가하는 능력이 제한적입니다. 예를 들어, 전통적인 함수는 에이전트가 첫 실행에서 도구를 호출했는지 여부는 평가할 수 있지만, 그 에이전트가 도구 결과를 사용하여 사용자의 질문에 성공적으로 답변했는지까지 평가하기는 어려울 것입니다. 개방형(open-ended) 작업에서는 동일한 도구 결과를 사용하는 여러 가지 유효한 방법이 있을 수 있으므로, 모든 허용 가능한 답변을 결정론적 논리로 인코딩하는 것은 코드 기반 평가의 좁은 범위 제한에 빠르게 부딪히게 됩니다.
여기에 LLM-as-a-judge가 등장했습니다. 이는 LLM을 사용하여 에이전트 트레이스(trace)의 비정형 입력(unstructured input)을 추론하고 점수를 매깁니다. LLM 심사관은 질문, 트레이스, 증거를 비정형 입력으로 받아들인 다음, 프롬프트를 사용하여 응답이 사용자의 요청에 부합했는지 평가합니다.

하지만 모든 에이전트 엔지니어가 입증하듯이, LLM 심사관은 완벽한 해결책이 아닙니다. 이들은 본질적으로 비결정론적(non-deterministic) 시스템이며, 이는 신뢰할 수 있는 테스트 장치에 견고한 기반을 제공하지 못합니다. 또한 전통적인 코드 기반 평가보다 실행 속도가 느리고 비용도 많이 듭니다.
에이전트 평가는 의사 결정 작업입니다. 즉, 에이전트의 상태와 행동이 주어졌을 때 피드백을 제공하는 점수를 할당하는 것입니다. Jev는 이 패턴을 위해 설계되었습니다. 이는 유형화된(typed) 질문을 구조화된 상태(structured state)에 대해 평가하고 확률과 함께 유형화된 답변을 반환합니다. 반면, 자기회귀 모델(Autoregressive models)은 토큰 단위의 생성(token-by-token generation)을 통해 판단에 도달합니다. 저희 실험에서 이러한 결정 우선 설계는 더 낮은 지연 시간(latency), 더 낮은 비용, 그리고 더 낮은 분산(variance)과 일치했습니다.

Jev는 세 가지 유형의 질문을 지원합니다:
Choice
하나의 옵션을 선택하고 확률과 신뢰도를 반환합니다. 예시: “어떤 검색 결과가 이 실행을 가장 잘 설명합니까?”
- 응답: One of
searched_appropriately
,
searched_unnecessarily
, 또는 failed_to_search
,
플러스 확률 및 신뢰도
Score
은 순서화된 루브릭(rubric)에 따라 답변을 평가하고 확률과 신뢰도를 반환합니다.``
``
예시: “답변의 유용성은 어느 정도인가?” - 응답: 1(도움이 안 됨)부터 5(매우 유용함)까지의 루브릭 점수, 플러스 확률 및 신뢰도
Noul
은 예/아니오 판단이 참일 확률을 반환합니다. 예시: “최종 답변이 검색된 증거에 근거하는가?”
- 응답:
0.0부터1.0까지의float값, 여기서1.0은 완전히 근거됨(fully grounded)을 의미합니다.
여러 개의 원자적 질문(atomic questions)은 동일한 상태에 대해 병렬로 평가될 수 있습니다.

에이전트의 동작, 검색된 데이터 또는 추적 컨텍스트가 실행마다 변경되면 심사관(judge)을 비교하기 어렵습니다. Deep Agents와 LangSmith를 사용하면 단일 에이전트 실행을 데이터셋으로 캡처하고 각 모델에 걸쳐 재현할 수 있습니다.
Jev를 이용한 평가 (Evaluation with Jev)
Jev의 성능을 테스트하려면 점수를 매길 에이전트가 필요했습니다. 저희는 오픈 소스 에이전트 하네스(agent harness)인 Deep Agents를 사용하여 목표 에이전트를 구축했습니다. 그런 다음 LangSmith 데이터셋으로 테스트 세트를 정의하여 각 평가자가 동일한 질문과 예상 동작에 대해 실행하도록 했습니다. 이 테스트 세트는 다섯 가지 날씨 요청으로 구성되어 있습니다:
.png)
데이터셋의 각 예시에 대해, 저희는 날씨 에이전트의 응답을 캡처하고 전체 출력을 LangSmith에 고정된 예시로 저장했습니다. 각 심사관은 품질(quality)이라는 연속 점수와 does_pass라는 이진 결정 두 가지 신호를 사용하여 다섯 개의 캡처된 실행을 평가했습니다.
.png)
정확성(correctness)과 재현 가능성(repeatability)을 분리하여 측정하기 위해, 저희는 인간 검토자에게 각 고정 응답에 대해 동일한 루브릭을 사용하여 레이블링하도록 했습니다. 인간 검토자의 레이블을 오라클 점수(oracle score)로 사용함으로써 정밀도(precision)와 정확성(correctness)이 전반적인 평가자 효과성에 미치는 영향을 더 풍부하게 분석할 수 있었습니다.
정확성(Accuracy)은 인간 오라클과의 일치 여부를 알려줍니다. 분산(Variance)은 평가자가 동일한 에이전트 행동에 대해 일관되게 같은 판단을 내리는지를 측정합니다. 낮은 분산이 반드시 높은 정확성을 의미하지는 않습니다. 평가자는 여전히 일관되게 틀릴 수 있기 때문입니다. 하지만 평가자가 정확할 때, 낮은 분산은 프로덕션 환경에서 그 정확성을 더욱 신뢰할 수 있게 만듭니다.
저희는 Jev를 GPT-5.6 Luna, GPT-5.6 Terra, 그리고 Claude Sonnet 4.6과 비교하여 100회 반복에 걸친 사례별 분산(per-case variance)과 인간 오라클과의 일치 여부를 계산했습니다.
평가 결과
정확성 (Accuracy)
인간 리뷰어의 레이블을 이 비교의 오라클로 사용하여, 저희는 이진(binary) 통과/실패 결정에 대한 정확성을 계산했습니다.
이진 does_pass 점수의 경우, Jev는 500개의 반복된 결정 모두에서 오라클과 일치했습니다. Terra는 99.8%의 결정에서, Luna는 96.4%에서, Claude는 80.0%에서 일치했습니다.

정밀도 (Precision)
정확성은 평가자가 인간 오라클과 동의했는지 알려줍니다. 정밀도는 에이전트 행동에 변화가 없을 때 동일한 품질 점수를 생성하는지 묻습니다. 저희는 각 평가자의 점수에서 관찰된 분산(observed variance)을 사용하여 정밀도를 측정했습니다.
Jev는 가장 낮은 관찰 평균 사례별 분산(0.0000149)을 보였습니다. Luna는 433× 더 높았고, Terra는 913× 더 높았으며, Claude는 92× 더 높았습니다.
이 실험만으로는 Jev의 점수가 왜 덜 변동했는지 설명할 수 없습니다. 한 가설은 이 모델들이 서로 다른 종류의 출력에 최적화되어 있다는 것입니다. TypeSafe는 Jev를 보정된 확률과 타입 지정된 답변을 반환하도록 훈련된 결정 모델로 설명하는 반면, 자기회귀(autoregressive) LLM 평가자는 평가자가 그 출력을 점수로 매핑하기 전에 텍스트를 생성합니다. 이러한 차이가 Jev를 이 제한적인 평가 작업에 더 적합하게 만들 수 있지만, 이는 관찰 결과일 뿐이며, 그 훈련 목표가 낮은 분산을 야기했다는 증거는 아닙니다.
.png)


비용 및 지연 시간 (Cost and latency)

비용 및 지연 시간 (Cost and latency)

비용이 낮다는 것은 에이전트 평가를 대규모로 실행하는 것이 실질적이라는 의미입니다. 평가자 호출(evaluator calls)에 비용이 많이 들 경우, 팀은 커버리지와 예산 사이에서 결정해야 합니다. 본 실험에서 콜당 $0.00035인 Jev는 이러한 상충 관계를 덜 심각하게 만듭니다. 팀은 더 많은 반복적인 판단과 더 자주 수행하는 회귀 검사(regression checks)를 감당할 수 있습니다. 이는 온라인 평가(online evaluation)에 더욱 중요하며, 콜당 비용이 낮으면 팀이 더 많은 판정가(judges)를 더 넓은 범위의 프로덕션 트레이스(production traces)에 걸쳐 실행하여 더 밀도 높은 피드백 신호(denser feedback signal)를 생성할 수 있게 합니다.

대규모 온라인 평가 구현 (Online evals unlocked at scale)
매일 10,000개의 트레이스를 생성하는 프로덕션 에이전트의 경우, 관찰된 콜당 비용은 의미 있는 운영상의 차이를 만듭니다.
낮은 비용의 호출이 유용한지 판단하기 위해, 우리는 **신호 가치(signal value)**를 이진 오라클 일치도(binary oracle agreement)에 이진 반복 가능성(binary repeatability)을 곱한 값으로 정의합니다. 반복 가능성은 동일한 트레이스에 대한 두 개의 독립적인 호출이 동일한 판정(verdict)을 반환할 확률입니다. 이는 정확하면서도 안정적인 판정가에게 보상을 주고, 일관되게 틀리는 판정가에게는 페널티를 부여합니다.

Jev와 같이 신호 가치가 높고 비용이 낮은 판정가는 온라인 평가에서 더 나은 가치를 구현할 수 있습니다. 팀은 더 많은 프로덕션 트레이스에 대한 피드백을 생성하고, 품질의 변화를 더 빨리 감지하며, 해당 피드백이 잘못된 방향으로 추세를 보이기 시작할 때 경고를 설정할 수 있습니다.
새로운 유형의 에이전트 평가 (A new type of agent evals)
오늘날 모든 에이전트 평가는 상충 관계를 안고 있습니다. 더 많은 에이전트 실행을 점수화하거나, 더 많은 차원을 평가하거나, 더 많은 변경 사항을 테스트하면 테스트 비용이 증가합니다. 이는 팀들이 원하는 만큼 적게 평가하도록 압박합니다.
본 실험에서 Jev의 판단 비용은 $0.00035였습니다. 낮은 비용 외에도 Jev는 높은 정확도와 낮은 분산(low variance)을 제공하여, 판정 결과가 신뢰할 수 있고 고신호(high-signal)임을 의미했습니다. 그 가격대에서 품질 좋은 판정가는 빌더들이 각 에이전트 실행을 여러 초점 기준에 맞춰 평가하고, 모든 에이전트 변경 사항을 측정하며, 확신이 필요할 때 판단을 반복할 수 있게 합니다.
이것은 뛰어난 에이전트를 구축하는 데 상당한 테스트와 모니터링이 필요하기 때문에 중요합니다. 에이전트를 자주 평가할수록 개발 주기에는 더 유용한 피드백이 들어옵니다.
하지만 이 실험의 결과가 다른 에이전트나 실제 워크플로우에도 적용될 수 있을지는 아직 지켜봐야 합니다. 또한, 낮은 비용은 실수를 증폭시킬 수 있습니다. 일관되게 잘못된 평가기는 대규모로 나쁜 피드백을 생성할 수 있기 때문입니다. 엔지니어들은 여전히 인간의 검토와 정렬(alignment) 판단을 워크플로우에 통합해야 합니다.
새로운 System One 스타일의 모델은 고품질 평가를 풍부하게 만들 수 있습니다. 이는 전체 에이전트 개발 라이프사이클을 가속화할 수 있습니다. 에이전트 엔지니어들은 더 많은 트레이스(traces)를 피드백으로 전환하고, 회귀(regressions)를 더 빨리 포착하며, 에이전트를 구축, 테스트, 모니터링 및 배포하면서 더 빠르게 움직일 수 있습니다. 여기서 핵심은 단순히 저렴한 평가가 아니라, 신뢰할 수 있는 에이전트 구축을 위한 더욱 긴밀한 피드백 루프입니다.
재현성 (Reproducibility)
본 프로젝트의 GitHub 저장소는 여기에서 확인할 수 있습니다.
저희는 LangSmith Gateway를 통해 LLM 평가기(judges)들을 GPT-5.6 Luna, GPT-5.6 Terra, 그리고 Claude Sonnet 4.6으로 실행했습니다. Jev는 langchain-typesafe==0.0.1a2를 통해 접근했습니다.
재현성을 위해 사용된 버전은 Deep Agents 0.7.15, LangChain OpenAI 1.6.2, LangSmith 0.12.6, 그리고 Tavily Python 0.8.3입니다. LLM 평가기에는 온도(temperature), top-p, 시드(seed), 또는 최대 토큰 수(max tokens)를 설정하지 않았으므로 각 제공업체의 기본값이 적용되었습니다. Jev 서비스 버전은 실험 메타데이터에 포함되어 있지 않습니다.
더 알고 싶으신가요?
Jev를 사용한 에이전트 구축에 대해 더 알고 싶다면, LangChain이 9월 22일 화요일에 TypeSafe AI 팀과 함께 라이브 스트림을 개최합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 LangChain Blog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기