35배 빠르고 토큰 제로: 의사결정 모델이 주류가 된 한 주
요약
최근 TypeSafe AI가 'Jev' 모델을 공개하며, 토큰 생성 없이 확률이나 선택지 같은 '타입화된 결정(typed decisions)'만 반환하는 의사결정 모델이 주목받고 있습니다. OpenAI와 Microsoft 역시 이 흐름에 동참하여 API 및 후속 학습을 통해 개발자 워크플로우의 새로운 표준을 제시하고 있습니다.
핵심 포인트
- LLM은 자기회귀적(autoregressive)으로 토큰을 순차 생성하는 방식입니다.
- 결정 모델은 언어 모델 헤드를 결정 헤드로 대체하여 단일 병렬 패스로 평가합니다.
- 이 방식은 토큰 비용 청구가 없고, 파싱 과정 없이 즉각적인 의사결정이 가능하게 합니다.
- 기존의 LLM + Regex JSON 파싱 워크플로우는 레거시 코드가 될 전망입니다.
9월 15일, TypeSafe AI가 Jev라는 모델을 공개하며 은밀한 상태를 벗어났습니다. 이 모델은 단 하나의 토큰도 생성하지 않습니다. 대신 확률, 선택지, 점수와 같은 '타입화된 결정(typed decisions)'만을 반환합니다. 3주 후, 두 거대 챗봇 문장 판매자들이 같은 길을 걸었습니다. 10월 6일, OpenAI는 Decisions API를 공개 베타로 출시했습니다. 그리고 10월 9일, Satya Nadella는 Microsoft Decision-1을 발표하며, 이 모델이 GPT-6 Sol보다 결정(decision)을 35배 더 빠르게 만든다고 주장했습니다. 한 스타트업은 소프트웨어가 문장이 아니라 분기할 수 있는 값(values it can branch on)을 원한다고 말합니다. 이번 주에 업계의 두 거대 기업들이 이 점에 동의했습니다.
(Jev 출시와 그가 '캘리브레이션 우선 학습(calibration-first training)'을 수행했다는 내용을 다룬 9월 24일 게시물 "말하지 않는 모델(The Model That Doesn't Talk)"의 후속편입니다.)
초보자도 이해할 수 있도록 설명하자면: 이제 대형 병원에서 판매하는 스탬프
챗봇은 모든 예/아니오 질문에 열 페이지짜리 에세이로 답하는 뛰어난 의사 같습니다. 당신은 그 에세이를 읽고, 답변을 찾아서 스프레드시트에 복사합니다.
반면 결정 모델(decision model)은 양식을 찍어주는 분류 간호사입니다: "긴급: 92%." 이 스탬프 자체가 전체 제품입니다.
이번 주에 새로워진 것은 누가 스탬프를 판매하느냐 하는 점입니다. 스타트업이 할 때는 하나의 가설(thesis)입니다. 하지만 OpenAI가 POST /v1/decisions을 구축하고 Microsoft가 이를 중심으로 모델 전체를 후속 학습(post-trains)한다면, 이는 새로운 카테고리(category)가 됩니다. 그리고 "LLM에 프롬프트를 넣고, 정규 표현식(regex)으로 JSON을 파싱하는" 방식으로 운영해 오던 모든 워크플로우는 이제 레거시 코드(legacy code)가 됩니다.
작동 방식: 한 번의 통과, 말 없음
LLM은 자기회귀적(autoregressive)입니다: 토큰, 전체 모델 통과, 토큰, 전체 모델 통과. 50개의 토큰으로 이루어진 JSON 답변은 가중치(weights)를 통해 50번의 순차적인 통과를 거칩니다. 그리고 당신은 원래 원했던 결정 값으로 되돌리기 위해 그 텍스트를 정규 표현식으로 파싱해야 합니다.
의사 결정 모델(decision model)은 기존 언어 모델 헤드(language-model head)를 **의사 결정 헤드(decision head)**로 대체하고 모든 것을 **단일 병렬 패스(one parallel pass)**에서 평가합니다. 토큰이 생성되지 않으며, 토큰에 대한 비용 청구도 없고, 파싱할 것도 없습니다. 출력은 사전에 유형화됩니다:
- Predicate: 특정 조건이 성립할 확률을 나타내는 0부터 1 사이의 확률값.
- Choice: 제공된 고정 옵션 중 하나이며, 각 옵션별 확률값을 가집니다.
- Score: 순서가 지정된 심각도 수준에 걸친 가중치 점수.
OpenAI의 버전은 텍스트(또는 base64 전용 이미지 — 호스팅 URL은 거부됨)와 질문 목록을 받아 답변을 반환하며, 이는 Responses API보다 "약 10배 빠르다"고 합니다. 비용은 입력 토큰당 백만 개에 $0.10이며 출력은 $0입니다. 독립 개발자들이 구조화된 작업 재현 테스트에서 평균 230ms의 중앙값과 78개 중 76개의 정답률을 측정했습니다. Microsoft의 Decision-1은 빠르고 단일 패스 의사 결정 점수화를 위해 Alibaba의 Qwen3.5-9B를 기반으로 추가 학습되었으며 — 예/아니오 질문, 객관식, 평점 부여 등 AI가 생성한 답변을 사전에 정의된 기준에 따라 평가하는 기능 — Microsoft는 이 모델이 정확도와 속도 측면에서 36개 벤치마크에서 최고 성과를 기록했다고 밝힙니다. 이미 인시던트 대응(incident response)을 포함하여 Microsoft 전반에 걸쳐 테스트되고 있습니다.
최신 기술 동향: 세 플레이어, 한 카테고리
| TypeSafe Jev 1.13 | OpenAI Decisions API | Microsoft Decision-1 | |
|---|---|---|---|
| 상태 | GA (Vercel AI Gateway를 통해 이용 가능) | Public beta (10월 6일), GA "몇 주 내 출시 예정" | 10월 9일 발표 |
| ... | |||
| 각각의 표준 워크로드(500 토큰으로 구성된 1백만 건 분류 작업)에 대한 비용을 비교했을 때, Jev는 약 $21이며, Decisions API는 $50, Responses API를 통한 GPT-6 Luna는 근접하게 $60($50 입력, 결정당 약 $10 출력 토큰). 비용 우위는 구조적입니다: 청구할 출력 토큰 자체가 존재하지 않기 때문입니다. |
세부 사항: 벤더의 숫자는 그저 숫자일 뿐
- OpenAI나 Microsoft 어느 쪽도 Responses API를 통해 동일한 모델에 대한 직접적인 정확도를 발표하지 않았습니다. 속도는 수치로 주장하지만, 정확도는 그렇지 않습니다. 위의 비용 차트는 오직 비용만을 다루고 있으니, 속도와 정확도는 별개의 문제로 취급해야 합니다.
- 연쇄 결정(Chained decisions)은 개별 요청입니다. OpenAI의 문서는 이전 답변에 의존하는 결정에는 두 번째 요청이 필요하다고 말합니다. 230ms의 중앙값으로 이루어진 다섯 개의 종속 단계는 1.15초가 걸리므로, 설계된 결정 그래프는 깊이가 얕습니다.
- 점수 유형은 레벨 사이에 위치할 수 있습니다. OpenAI 자체 예시에서는 세 가지 심각도 레벨에 걸쳐 발생 확률이 각각 0.1, 0.7, 0.2인 경우의 확률을 1.1이라는 점수로 변환하는데, 이 숫자는 어떤 레벨에도 해당하지 않습니다. 임계값을 설정하기 전에 자신의 유형 시스템을 이해해야 합니다.
- 출시 당시
/v1/decisions는 Luna 자체 문서에 포함되어 있지 않았습니다. 모델의 18개 행 엔드포인트 지원 표에는 Chat Completions, Responses, Batch가 나열되었지만, 이 새로운 엔드포인트는 아니었습니다. 베타 버전은 미흡하지만, 구축하기 전에 확인해야 합니다.
해자(Moat)에 대한 질문
Hacker News는 예측 가능한 방식으로 양분되었습니다. 절반은 OpenAI가 해당 카테고리를 검증했다고 주장했고, 검증은 Jev에게 2주의 독점 기간보다 더 가치 있다고 여겼습니다. 나머지 절반은 해자는 애초에 존재하지 않았다고 주장했습니다. 만약 OpenAI가 스타트업보다 2주 후에 이것을 출시할 수 있다면, 누구든 할 수 있다는 논리입니다. 두 진영 모두 옳으며, 이것이 개발자 도구에 대한 불편한 진실입니다.
정직한 점수표: Jev는 일반 사용 가능(GA) 버전을 유지하고, 가장 낮은 가격($1백만 결정당 21달러 대 50달러)과 보정(calibration)-우선 학습을 제공합니다. 즉, 신뢰도 수치 자체가 제품입니다. OpenAI는 이미지 기능, 이미 가지고 있는 SDK, 그리고 측정된 속도의 head-to-head 비교 우위(중앙값 230ms 대 500ms; 정답률 76/78 대 73/78)를 유지합니다. Microsoft는 자체 호스팅(self-hostable) 관점을 가져옵니다. 즉, 폐쇄형 API가 아닌 오픈 가중치 기반 모델에 대해 사후 학습된 의사결정 모델입니다.
핵심 요약 (Takeaways)
- 챗봇을 분류용으로 사용하는 것은 구식(legacy) 방식입니다. 파이프라인의 끝이 정규표현식(regex)이라면, 버려지는 문장에 대해 비용을 지불하고 있는 것입니다.
- 지연 시간 및 비용 우위는 마케팅이 아닌 기술적 우위입니다. 토큰 출력이 없다는 것은 청구할 것도 없고 파싱할 것도 없다는 의미입니다.
- 보정(Calibration)과 체인 연결은 여전히 사용자에게 달려 있습니다. 임계값(Thresholds)에는 레이블링된 이력(labeled history)이 필요합니다. 자동화하기 전에 해당 세트를 구축해야 합니다. 의사결정 그래프는 얕게 유지하세요.
- GA 가격을 주시하십시오. OpenAI의 베타 가격은 입력 전용이며 일반 사용 가능 시점에서는 확정되지 않았습니다. 오늘날 Jev의 강점은 가격과 보정입니다. OpenAI의 강점은 속도와 배포(distribution)입니다. Microsoft의 강점은 오픈 가중치 자체 호스팅입니다.
출처: OpenAI Decisions API 가격/비교 · MarkTechPost 베타 커버리지 · 150ms 분류 벤치마크 · Microsoft Decision-1 발표
동반 노트북: 이 게시물의 실행 가능한 튜토리얼입니다 — 여기에서 다운로드 (Colab/Jupyter에서 열기).
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기


