Jev를 GTM에 활용하기 - 고객 분류부터 워크플로 자동화까지
요약
TypeSafe AI가 개발한 Jev는 문장 생성 대신 선택지 분류, 점수 산정 등 구조화된 판단을 반환하는 AI 모델입니다. 이는 영업/마케팅 자동화 워크플로에서 반복적인 의사결정을 효율적으로 처리하며, 기존 LLM 대비 속도와 비용 면에서 큰 이점을 제공합니다.
핵심 포인트
- Jev는 문장 생성 대신 구조화된 판단(선택지, 점수, 예/아니오)을 반환합니다.
- 반복적인 영업/마케팅 의사결정 자동화에 최적화되어 있습니다.
- LLM 대비 193배 빠르고 445배 저렴하여 비용 효율성이 높습니다.
- RLCD 학습 방식을 통해 확률과 실제 정답률을 일치시키는 데 중점을 둡니다.
Jev는 고객 분류, 적합도 점수, 구매 신호처럼 반복되는 영업/마케팅 판단을 자동화하는 AI 모델로, 문장 대신 미리 정한 형식의 답과 확률을 반환함
- 선택지 분류, 점수 산정, 예/아니오 판단을 지원하며, 한 번의 API 호출에서 여러 질문을 독립적으로 병렬 처리 가능
- 판단 결과와 함께
선택지별 확률과 신뢰도를 제공해 자동 처리, 담당자 검토, 추가 조사로 작업을 나눌 수 있음 - Clay에서는
Claygent가 조사 → Jev가 판단 → 통과한 행에만 LLM이 글 작성 순서로 연결해 불필요한 데이터 보강과 생성 비용을 줄이는 방식 - 입력 100만 토큰당
$0.042이며, 약 193배 빠르고 445배 저렴하다는 수치는 TypeSafe 자체 테스트 결과로 실제 업무에서 얻을 개선 폭의 상단에 해당함
문장 생성 대신 소프트웨어가 사용할 판단을 반환
- ChatGPT 개발에 참여한 Diogo Almeida가 설립한 TypeSafe AI의 모델로, 약 2년간의 비공개 개발 후 공개됨
- 출발점은 “모델이 이렇게 똑똑한데 왜 실제 업무의 자동화는 적은가?”라는 질문
- TypeSafe의 목표는 지능을 코드처럼 조합할 수 있게 만들어 더 많은 소프트웨어에 넣는 것
- Jev는 입력 텍스트인
state
와 판단 기준을 받아 타입이 정해진 답을 반환함
- 모델 계열 이름인 System One은 대니얼 카너먼의 빠르고 직관적인 System 1 사고와 느리고 숙고하는 System 2 사고의 구분에서 따옴
세 가지 질문 형식
Choice: 최대 255개 선택지 중 하나를 고르고, 선택지별 확률과 신뢰도를 반환
Score: 사용자가 정의한 210개 수준을 기준으로 점수, 수준별 확률, 신뢰도를 반환1 사이의 확률을 반환
Noul: 예/아니오 질문에 대해 0
- 한 번의 요청으로 인물 유형, 이상적인 고객상인 ICP에 대한 적합도, 구매 신호를 각각 판단 가능
LLM과 함께 쓰는 판단 모델
- LLM이 이메일, 요약, 대화처럼 문장을 생성한다면 Jev는 정해진 선택지와 숫자를 반환함
- 클럽 입구에서 정해진 기준으로 입장을 판단하는 직원과, 대화를 나누고 음료를 추천하는 바텐더에 비유할 수 있음
- LLM은 토큰을 순차적으로 생성하지만, Jev는 판단 결과를 한 번에 병렬로 산출함
- 학습 방식인
RLCD, Reinforcement Learning for Calibrated Decisions는 확률과 실제 정답률을 맞추는 데 초점을 둠 - 예를 들어 0.8이라는 확률이 반복적으로 약 80%의 정답률에 대응하도록 만드는 것이 목표
성능 수치와 판단의 범위
- 약 193배 빠르고 445배 저렴하다는 수치는 TypeSafe의 자체 워크플로 테스트에서 나온 결과
- 출시 발표에서도 실제 사용에서 얻을 개선 폭의 상단에 해당할 것으로 예상함
- “환각이 수학적으로 불가능하다”는 표현은
미리 정의한 출력 형식과 선택지 밖의 답을 만들어내지 않는다는 범위 - 선택지 안에서 잘못된 답을 고르는 것은 가능하며, 판단 기준의 문구를 문자 그대로 해석함
- 컨텍스트 한도는 64,000토큰이며, 판단에 필요하지 않은 정보를 더 넣으면 정확도가 낮아질 수 있음
영업/마케팅 업무에 적용하는 방법
- Clay 같은 영업/마케팅 자동화 도구에서는 글쓰기보다 작은 판단을 수만 번 반복하는 작업이 많음
- 직함이 구매 담당자에 해당하는지, 회사가 ICP에 맞는지, 채용 공고가 구매 신호인지, 답장이 “지금은 아님”인지 “관심 없음”인지 등을 판단
- 매번 같은 출력 형식을 유지해야 다음 열과 후속 자동화에서 결과를 바로 사용할 수 있음
주요 활용 사례
인물 유형 분류: 회사를 운영하는 창업자, 투자자, 초기 직원, 창업자 지원 조직 등을 구분
고객 적합도 산정: 회사가 정의한 ICP에 얼마나 부합하는지 단계별 점수로 반환
구매 신호 탐지: 채용 공고, 보도자료, 실적 발표에서 특정 조직이나 기술 도입의 신호를 찾고 확률순으로 정렬
답장 분류와 전달: 관심 있음, 나중에 연락, 담당자 아님, 수신 거부, 부재중 등으로 나누고 신뢰도가 낮은 건은 사람이 검토
분류 체계 정규화: 제각각인 산업, 부서, 기술 스택 이름을 회사가 사용하는 분류로 변환
조사 결과 확인: Claygent가 수집한 내용이 특정 주장이나 판단을 뒷받침하는지 검사
비용 발생 전 필터링: 적합하지 않은 행을 먼저 걸러 유료 데이터 보강과 LLM 호출을 줄임
작업에 맞는 도구 선택
- 도메인 일치, 직원 수 50명 초과처럼 명확한 규칙으로 처리할 수 있으면 수식이나 조회 사용
- 판단이 필요하고 답이 분류, 점수, 예/아니오라면 Jev 사용
- 이메일, 첫 인사말, 요약처럼 문장이 필요하면 LLM 사용
- 웹 검색이나 여러 단계의 조사가 필요하면 Claygent 사용
Claygent 조사 → Jev 판단 → 기준을 통과한 행에만 LLM 글쓰기 순서로 구성 - 판단 기준 자체가 모호하다면 모델 호출에 앞서 ICP와 분류 기준부터 구체화할 필요가 있음
Clay에 연결하고 신뢰도를 후속 작업에 반영
- 원문 작성 시점에는 Clay의 네이티브 Jev 연동이 없어 HTTP API 열로 연결
- TypeSafe 콘솔에서 API 키를 발급하고, Playground에서 샘플 데이터를 먼저 넣어 질문과 기준을 조정
- Clay의 필요한 필드를
state
에 넣고, questions
에 판단 기준을 정의해 API로 전달
- 예를 들어 직함, 회사, 직원 수, 산업 정보를 이용해 인물 유형과 고객 적합도를 한 번에 판단 가능
state
에는 판단에 필요한 필드만 짧고 이름을 붙여 전달하고, 전체 데이터 보강 결과를 그대로 넣지 않음
- 정보가 부족할 때 억지로 분류하지 않도록
unclear
같은 선택지를 포함
- Score는 정수 등급 대신 가중평균을 반환하므로, 팀에서 등급이 필요하면 반올림하거나 구간으로 변환
신뢰도에 따른 처리 예시
0.90 이상: 영업 연락 시퀀스에 자동 등록
0.70 이상, 0.90 미만: 담당자 검토
0.70 미만: 추가 조사로 보내거나 후속 작업 제외
- 위 수치는 시작을 위한 예시이며, 되돌리기 어려운 작업에는 더 엄격한 기준 적용
- 필요한 입력이 채워진 행에만 Jev를 실행하고, 판단 결과를 통과한 행에만 유료 데이터 보강과 이메일 생성을 실행
작은 표본으로 기준을 다듬고 비용 절감
- 처음부터 20,000개 행을 실행하기보다
50개 행으로 시험하고, 그중 20개를 직접 분류해 비교 - 틀린 결과가 나오면 최종 선택뿐 아니라 선택지별 확률도 확인
- 올바른 답이 두 번째로 높은 확률을 받았다면 선택지의 기준이 겹치거나 모호한지 먼저 점검
Enterprise
와 Large company
처럼 겹치는 선택지를 피하고, 정보 부족을 나타내는 선택지를 마련
- 정확도가 낮아졌을 때 정보를 계속 추가하기보다, 사람이 판단하는 데 필요한 정보만 남겨 다시 시험
API 비용
- 공개 입력 가격은
100만 토큰당 $0.042 - 요청당 입력이 약 300토큰이라면 행당 약 $0.0000126,
10만 개 행에 약 $1.26의 API 비용으로 계산됨 - 이 금액은 해당 입력량을 가정한 Jev API 비용
- 더 큰 절감 효과는 Jev가 걸러낸 행에서 유료 데이터 보강과 LLM 글쓰기를 실행하지 않는 데서 발생
추가 자료
댓글과 토론
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기