Jev를 레드팀 가드레일로 활용하기: TypeSafe의 모델을 AI 보안에 적용하다
요약
본 기사는 TypeSafe의 Jev를 AI 보안 가드레일로 활용하는 방법을 다루며, 1,580개의 레드팀 프롬프트를 테스트했습니다. Jev는 GPT-5-mini, Claude Haiku 4.5 등 주요 LLM 대비 속도와 비용 효율성이 뛰어나고 높은 차단 정확도를 보였습니다. Jev는 자유 형식의 텍스트가 아닌 확률과 선택지를 반환하는 '결정' 기반 작업에 최적화되어 있습니다.
핵심 포인트
- Jev는 프롬프트 가드레일로 활용 가능하며, 레드팀 테스트에서 우수한 성능을 입증했습니다.
- LLM 대비 속도(5~6배)와 비용(6~27배) 효율성이 뛰어나 운영에 유리합니다.
- Jev는 텍스트 생성 대신 확률과 선택지를 반환하는 '결정' 작업에 최적화되어 있습니다.
- 가드레일, 라우팅, 분류 등 AI 시스템의 중요 경로에서 활용 가치가 높습니다.
TypeSafe의 Jev를 프롬프트 가드레일로 1,580개의 red-teaming 프롬프트를 GPT-5-mini, Claude Haiku 4.5 및 세 가지 오픈 소스 가드 모델과 비교했습니다. 그 결과, 속도는 56배 빠르고 비용은 627배 저렴했으며, 호스팅된 모델 중 가장 높은 차단 정확도를 보였습니다.
TypeSafe의 Jev는 적은 시간과 비용으로 LLM 수준의 의사결정을 제공할 것을 약속합니다. 우리는 이 주장을 실제 테스트에 적용해 보았습니다. 즉, AI 에이전트에게 도달하기 전에 프롬프트를 검열하는 가드레일로 Jev를 사용한 것입니다. 공개된 jailbreak, prompt-injection 및 유해 콘텐츠 벤치마크에서 가져온 1,580개의 red-teaming 프롬프트를 대상으로, 속도, 비용, 그리고 각 모델이 무엇을 차단하고 어떤 위험으로 명명하는지에 대한 판단력을 기준으로 Jev를 OpenAI GPT-5-mini, Claude Haiku 4.5 및 세 가지 오픈 소스 가드 모델과 비교했습니다.
Jev에 대한 과대광고(Hype)
TypeSafe는 이 헤드라인 [1]으로 Jev를 출시했습니다:

왜 과대광고일까요? 자릿수 차이인가요? LLM과 비교하는 것이 공정한가요? 속도가 어디서 나오는지, 그리고 그것이 유지되는지 깊이 파헤쳐 보겠습니다.
Jev와 LLM의 차이점
높은 수준에서 볼 때, Jev는 사용자가 제공한 프롬프트나 컨텍스트를 상태(state)로 사용하여 정의된 선택지 또는 행동 세트 각각에 대한 확률을 예측합니다.
- 출력 결과가 타입 지정되어 있습니다. Jev는 자유 형식의 텍스트가 아닌 확률과 선택지를 반환합니다. 구문 분석할 것이 없으며, 잘못된 형태의 출력은 발생할 수 없습니다.
- 비용 구조가 다릅니다. Jev는 입력 토큰에 대해서만 비용을 청구하며, 출력은 무료입니다 [2]. LLM은 입력과 출력을 모두 청구하며, 특히 출력에 대해 더 높은 요율을 적용합니다.
- 지연 시간(Latency)이 답변 길이에 따라 증가하지 않습니다. 단일 점수 측정 과정은 답변이 길어진다고 해서 느려지지 않습니다. 왜냐하면 토큰 단위로 작성할 답변 자체가 없기 때문입니다.
Jev가 더 적합한 경우
Jev는 LLM을 대체하는 것이 아닙니다. 답변을 작성하거나, 문서를 요약하거나, 코드를 생성하지 않습니다. 이것이 목표로 하는 것은 AI 시스템 내부에서 출력이 _결정(decision)_인 대규모 작업군입니다:
- 입력이나 행동을 차단해야 할지 결정하는 가드레일(guardrails)
- 요청을 올바른 모델, 도구 또는 팀으로 라우팅(routing)하는 것
- 높은 볼륨에서의 분류(classification), 중재(moderation) 및 분류 처리(triage)
- 에이전트 워크플로우에서 다음 행동을 선택하는 것
이러한 결정들은 종종 모든 요청의 중요 경로(critical path)에 위치합니다. 그런 위치에서는 추가되는 매 초와 추가되는 센트마다 호출당 비용이 발생합니다. 바로 이런 곳에서 오직 결정만을 위해 구축된 모델이 가장 많은 이점을 얻을 수 있습니다.
테스트한 내용: 레드팀 가드레일로서의 Jev
에이전트 보안은 이러한 종류의 모델에 대한 자연스러운 테스트입니다. 가드레일은 하나의 입력을 읽고 두 가지 호출을 해야 합니다:
- 이 입력은 차단되어야 하는가? 유해한 요청, 탈옥(jailbreak) 시도 또는 문서나 도구 응답 내부에 숨겨진 프롬프트 인젝션일 수 있습니다.
- 어떤 종류의 위험인가?
두 번째 질문에 대해 모든 모델은 24가지 위험 범주(risk categories) 중에서 선택하며, 각 프롬프트가 소스 데이터셋에서 지니는 위험 범주는 그 기준 진실(ground truth)입니다. 이 중 22개는 RedBench의 위험 분류 체계 [3]에서 가져왔습니다. 우리는 무해한 입력에 대해 _No risk_를, 특정 피해를 목표로 하지 않는 탈옥 및 인젝션 시도에 대해 _Prompt attack_를 추가했습니다.
| 위험 범주 | 포함 범위 |
|---|---|
| No risk | 무해한 요청; 경고성 단어를 사용하더라도 정상적으로 답변해도 안전함 |
| ... |
데이터
우리의 시작점은 37개의 레드팀(red-teaming) 벤치마크를 통합한 RedBench [3]였습니다. 여기에 공격이 도구 응답에 심어진 에이전트 전사 기록을 포함하여, 전용 탈옥(jailbreak) 및 프롬프트 주입(prompt-injection) 데이터셋 [4–11]을 추가했습니다. 총 41,443개의 프롬프트 풀에서, 우리는 14개 데이터셋에서 추출한 1,580개(유해 1,310개, 무해 270개)의 계층화된 샘플을 평가했습니다.
모델 (Models)
우리는 동일한 지침과 동일한 24개 범주의 위험 분류 체계(risk taxonomy)를 사용하여 세 가지 호스팅 모델에 같은 작업을 부여했습니다: TypeSafe Jev [2], OpenAI GPT-5-mini [12] 및 Anthropic Claude Haiku 4.5 [13].
결과 및 관찰 (Results and observations)
속도, 비용 및 품질 (Speed, cost and quality)
Jev의 중앙 지연 시간(median latency)은 0.17초로, GPT-5-mini의 1.00초와 Claude Haiku 4.5의 0.89초에 비해었습니다. 이는 GPT-5-mini보다 약 6배 빠르며, Haiku보다는 5배 이상 빠릅니다. 95번째 백분위수(95th percentile)에서도 Jev는 0.26초를 유지한 반면, 두 LLM은 1.3초를 초과했습니다.
1,580개 프롬프트 전체를 분류하는 데 Jev는 $0.08, GPT-5-mini는 $0.48, Claude Haiku 4.5는 목록 가격 기준으로 각각 $2.23이 소요되었습니다. 이는 동일한 작업 부하(workload)에서 Jev가 GPT-5-mini보다 약 6배 저렴하고 Haiku보다 27배 저렴함을 의미합니다.
우리가 측정한 격차는 TypeSafe가 발표한 헤드라인 수치보다 작습니다. 이는 예상된 결과입니다. 그들의 수치는 선택된 기준선(baselines)에 대한 System One 작업 흐름을 설명합니다. 반면, 우리의 데이터는 단일의 적대적 분류 작업에서 나온 것이며, 널리 사용되는 저비용 LLM 두 가지와 비교되었습니다. 방향성은 그들의 주장에 부합하지만, 격차의 크기는 작업과 무엇과 비교하느냐에 따라 달라집니다.
속도와 비용은 결정이 유효할 때만 의미가 있습니다. 모든 프롬프트를 통틀어 Jev는 피해를 올바르게 플래그 지정하는 비율(차단 정확도)에서 85.5%를 기록하여, GPT-5-mini의 84.1%, Claude Haiku 4.5의 80.1%에 앞섰습니다.
24가지 위험 범주 중 정확한 카테고리를 명명하는 능력(카테고리화 정확도)에서는 Jev가 58.0%를 기록하여, 56.0%와 55.4%에 앞섰습니다.

24개 범주 전체에 걸친, 크기에 관계없이 모든 범주를 동등하게 가중하는 매크로-F1(macro-F1) 점수는 46.5%를 기록하여, 41.7%와 38.1%에 앞섰습니다.
탐지 품질 (Detection quality)
레이블링된 프롬프트가 20개 이상인 각 위험 범주별 카테고리화 정확도:

이러한 범주들 중 Jev는 아홉 가지(범죄, 학대성 콘텐츠, 허위 정보, 사이버 보안 위협, 편향, 데이터 프라이버시, 성적 콘텐츠, 경제적 피해 및 중요 시스템에서의 의사 결정)에서 가장 높은 카테고리화 정확도를 보였습니다. GPT-5-mini는 혐오 콘텐츠(hateful content), 악성 코드(malware), 폭력 콘텐츠(violent content), 불법 무기 분야에서 선두를 차지했습니다. Haiku는 무해한 입력(No risk)과 프롬프트 공격을 인식하는 데 가장 강력하며, 자해(self-harm) 영역에서는 GPT-5-mini와 동률로 Jev보다 앞섰습니다.
작업별 모델과의 비교 (Comparison with task-specific models)
또한, T4 GPU에서 가드레일링(guardrailing)을 위해 특별히 구축된 세 가지 오픈 소스 모델, 즉 Qwen3Guard-Gen-4B [14], Llama Prompt Guard 2 86M [15], 그리고 ProtectAI DeBERTa-v3 prompt-injection v2 [16]를 실행했습니다. 이들 중 어느 것도 24가지 위험 범주에 대해 답변하지 않았기 때문에, 블록 정확도(block accuracy)만을 기준으로 Jev와 비교했습니다.
공격 도메인 전반의 성능을 비교하기 위해, 우리는 각 프롬프트가 포함하는 종류에 따라 원본 벤치마크를 아홉 개의 벤치마크 그룹으로 분류했습니다. 이 그룹들은 결과를 집계하는 데만 사용되며, 모델이 예측하는 레이블은 아닙니다.
| 벤치마크 그룹 | 테스트 내용 | 포함된 벤치마크 |
|---|---|---|
| 유해한 지침 및 질문 세트 | 명백하게 작성된 유해 요청 및 질문 | AdvBench, CatQA, CoNA, ControversialInstructions, DAN, DoNotAnswer, ForbiddenQuestions, GPTFuzzer, HarmBench, HarmfulQ, HarmfulQA, JBB-Behaviors, MaliciousInstruct, MaliciousInstructions, MedSafetyBench, QHarm, SGBench, StrongREJECT (모두 RedBench [3]를 통해) |
| ... |
Qwen3Guard는 모든 벤치마크 그룹에서 점수가 매겨집니다. Prompt Guard 2와 ProtectAI는 프롬프트 공격만 감지하므로, 전체 실행 시에는 해당 모델이 테스트된 탈옥(jailbreak) 및 프롬프트 주입(prompt-injection) 그룹에만 나타납니다.

Jev는 아홉 개의 벤치마크 그룹 중 여덟 개에서 모든 작업별 모델과 같거나 더 나은 성능을 보였습니다.
- 명확한 유도(Clear leads): 직접적인 프롬프트 주입(direct prompt injection) (ProtectAI 대비 95%, Qwen3Guard 대비 88%), 사이버 공격 지원(cyberattack assistance) (67% 대비 83%), 유해 발언 및 안전하지 않은 조언(toxic statements and unsafe advice) (38% 대비 49%) 그리고 간접적인 프롬프트 주입(indirect prompt injection) (70% 대비 77%).
- 좁은 범위의 유도(Narrow leads): 유해한 지침(harmful instructions) (90% 대비 92%) 및 혼합 안전 스위트(mixed safety suites) (42% 대비 47%).
- 수준(Level): 자동화된 탈옥(automated jailbreaks) (양쪽 모두 96%) 및 과도한 거부(over-refusal) (양쪽 모두 72%).
- 배경(Behind): 탈옥 프롬프트 컬렉션(jailbreak prompt collections)의 경우, Qwen3Guard가 약간 앞서며 (ProtectAI 대비 92.9% 대 93.3%).
두 프롬프트 공격 분류기(prompt-attack classifiers)는 Jev보다 뒤처집니다. Prompt Guard 2는 커버하는 모든 그룹에서 Jev와 Qwen3Guard보다 뒤떨어집니다. ProtectAI는 직접 주입에서는 Qwen3Guard를 능가하지만, Jev에는 미치지 못합니다. 두 모델 모두 도구 응답에 숨겨진 간접 주입(indirect injection)에서는 33%의 점수를 받았습니다.
두 가지 주의사항이 적용됩니다:
- 혼합 안전 스위트와 유해 발언은 모든 모델에게 어렵습니다. 모든 점수가 50% 미만입니다.
- 간접 프롬프트 주입(indirect prompt injection)은 호스팅된 LLM에 대해 Jev가 가장 취약한 그룹으로 남아있으며, 이 영역에서는 두 모델 모두 91%에 도달했습니다.
기업에게 이것이 의미하는 바
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기


