a16z가 Typed, Machine-Native AI에 8억 7천만 달러 투자: 오픈 벤치마크로 검증된 버전 공개
요약
a16z가 TypeSafe AI의 Jev에 8억 7천만 달러를 투자하며, 차세대 AI는 채팅이 아닌 기계 네이티브 출력 형태여야 한다고 강조했습니다. 모델은 사람이 읽을 수 있는 산문 대신, 소프트웨어가 직접 소비할 수 있는 타입 지정된 구조화된 결정을 반환해야 합니다. 이 기술은 Zero-Token Confidence(ZTC) 방식을 통해 결정론적이고 저렴하게 작동하며, 오픈 벤치마크인 S1MB에서 최고 성능을 입증했습니다.
핵심 포인트
- AI의 미래는 채팅이 아닌 기계 네이티브 출력이다.
- 모델은 타입 지정된 구조화된 결정을 반환해야 한다.
- Zero-Token Confidence(ZTC)로 결정론적이고 저렴한 추론이 가능하다.
- S1MB 벤치마크에서 최고 성능을 기록하며 기술력을 입증했다.
요약
Andreessen Horowitz는 TypeSafe AI의 Jev라는 제품으로 75억 달러의 기업 가치를 인정받아 8억 7천만 달러 규모의 Series A 투자를 주도했습니다. 핵심 아이디어는 간단하며, 저희가 보기에 정확합니다: 다음 세대의 AI는 채팅이 아니라 기계 네이티브(machine-native) 출력입니다. 모델은 사람이 읽고 다시 파싱해야 하는 문단이 아니라, 소프트웨어가 직접 소비할 수 있는 타입이 지정된(typed), 구조화된 결정을 반환해야 합니다.
저희도 이 논지에 동의합니다. 또한 이를 오픈 소스로 구현하고 측정했습니다. 저희의 typed-decision judge는 System One Mosaic Benchmark (S1MB)에서 102개 모델 중 랭킹 1위를 차지했으며, 단일 순방향 패스(forward pass)로 제로 토큰(zero generated tokens)을 사용하여 결정을 반환합니다. 코드와 가중치 모두 공개되어 있습니다.
Typed, Machine-Native AI란 무엇인가?
일반적인 채팅 모델은 자유 형식의 텍스트로 답변합니다. 그러면 프로그램이 그 텍스트를 파싱하고, 구조를 추측하며, 모델이 이탈(drift)하지 않았기를 기대해야 합니다. 타입 지정된 모델은 산문(prose)을 건너뜁니다. 주어진 조건과 선택지 세트를 바탕으로, 결정 자체—레이블, 클래스, 점수—를 반환합니다. 출력에 타입이 있기 때문에 호출하는 소프트웨어는 취약한 파싱 계층 없이도 그 결과로 작동할 수 있습니다.
이는 대부분의 실제 시스템이 에세이를 원하지 않기 때문에 중요합니다. 라우터는 8개의 백엔드 중 하나를 선택하기를 원합니다. 모더레이션 파이프라인은 판결을 원합니다. 트레이딩 또는 가격 책정 서비스는 점수가 매겨진 선택지를 원합니다. 이 모든 경우에 생성(generation)은 오버헤드이며, 생성되는 모든 토큰은 환각(hallucinate)할 기회를 제공합니다.
제로 토큰이 경제성에 미치는 영향
출력이 결정이라면, 디코딩 루프 자체가 필요하지 않습니다. 저희의 접근 방식인 ZTC (Zero-Token Confidence)는 문제를 하나의 순방향 패스로 읽고, 최종 레이어의 은닉 상태(hidden state)를 가져와 보정된 프로브(calibrated probe)를 적용하여 결정을 생성합니다. 토큰이 생성되지 않습니다. 이는 결과를 결정론적(deterministic)으로 만들고, 모든 요청에서 실행하기에 충분히 저렴하며, LLM을 사용하여 다른 LLM을 판단할 때 발생하는 두 번째 모델의 환각으로부터 자유롭습니다.
실제로 얼마나 잘 작동하는가?
S1MB(System One Mosaic Benchmark)에서 당사의 모델 Darwin-27B-ZTC-v2는 102개 모델 중 전반적으로 최고 순위를 차지했으며, typed-decision 정확도는 zero-shot으로 0.743을 기록했습니다. S1MB는 다양한 유형의 작업(typed tasks)에 걸쳐 빠르고 직관적인 의사결정 품질을 측정하며, 이는 기계 네이티브 모델(machine-native model)이 유용하기 위해 필요한 정확한 역량입니다.
| 순위 | 벤치마크 | 모델 수 | 결과 |
|---|---|---|---|
| Number 1 | S1MB (typed decisions) | 102 | 0.743 accuracy, zero-shot |
리더보드는 공개되어 있으니 직접 확인하실 수 있습니다.
오픈 스택
이 자금 조달 소식은 이 분야를 검증합니다. 여기는 Apache-2.0 하에 오늘 바로 사용할 수 있는 부분입니다:
- ZTC 패밀리: 방법론 및 추론 코드는 github.com/final-bench/ztc에서 확인할 수 있습니다.
- Darwin-27B-ZTC-v2: S1MB 최고 모델은 github.com/final-bench/s1mb에서 확인할 수 있습니다.
- ONGRID: 온톨로지 그래프(ontology graph)와 검색(retrieval), 그리고 typed decision 엔진을 결합한 시스템으로, github.com/final-bench/ongrid에서 확인할 수 있습니다.
- POCKET: 결정이 로컬에서 실행되어야 할 때를 위한 온디바이스 CPU 모델이며, github.com/final-bench/pocket에서 확인할 수 있습니다.
대규모의 자금력이 풍부한 회사가 이제 시장에 typed, 기계 네이티브 AI가 방향이라고 말하고 있습니다. 저희는 그것이 옳다고 생각합니다. 차이점은 폐쇄된 제품을 기다릴 필요 없이 바로 시도할 수 있다는 것입니다.
FAQ
typed decision AI란 무엇인가요?
이는 프로그램이 파싱해야 하는 자유 형식 텍스트(free-form text) 대신, 레이블, 클래스 또는 점수와 같이 소프트웨어가 직접 소비할 수 있는 구조화되고 typed된 출력을 반환하는 AI 모델입니다.
ZTC (Zero-Token Confidence)란 무엇인가요?
ZTC는 모델의 최종 hidden state에 calibrated probe를 적용하여 단일 forward pass로 결정을 내리고 토큰을 생성하지 않는 방법론입니다. 이는 결정당 하나의 forward pass 비용이 들며, 결정론적(deterministic)입니다.
S1MB에서 최고 성능의 모델은 무엇인가요?
Darwin-27B-ZTC-v2가 102개 모델 중 System One Mosaic Benchmark(S1MB) 전반에서 최고 성능을 기록했으며, zero-shot으로 0.743의 typed-decision accuracy를 달성했습니다.
폐쇄형 typed-AI 제품에 대한 오픈 대안이 있나요?
네. S1MB 최고 모델인 ZTC 계열, ONGRID 엔진, 그리고 POCKET 온디바이스 모델 모두 Apache-2.0 라이선스 하에서 오픈 소스로 공개되어 있습니다.
LLM 심판 대신 왜 zero 토큰을 사용하나요?
LLM 심판은 토큰 단위로 비평(critique) 토큰을 생성하기 때문에 느리고, 비결정적이며, 자체적인 환각(hallucination)을 추가할 수 있습니다. 반면, zero-token 결정 방식은 결정론적이고 모든 요청에서 실행하기에 충분히 저렴합니다.
더 읽어보기
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기