S1MB 랭킹 1위: 토큰 제로(Zero Tokens)를 사용한 결정 엔진의 성능
요약
Darwin-27B-ZTC-v2 모델이 S1MB(System One Mosaic Benchmark) 결정 엔진 랭킹에서 1위를 차지했습니다. 이 모델은 일반적인 텍스트 생성 방식 대신, 단 한 번의 순방향 전파만으로 결정을 도출하는 ZTC(Zero-Token Confidence) 방식을 사용합니다. 이는 빠르고 결정론적이며 타입화된 결정에 최적화되어 있습니다.
핵심 포인트
- S1MB는 단순 텍스트 생성이 아닌, '타입화된 결정' 품질을 측정하는 벤치마크입니다.
- ZTC 방식은 전체 생성 루프를 건너뛰고 단일 순방향 전파로 결정을 산출하여 효율적입니다.
- 이 방법 덕분에 모델의 출력이 결정론적이어서 재현성과 신뢰성이 높습니다.
요약
System One Mosaic Benchmark (S1MB) 결정 엔진 랭킹에서, 저희 모델인 Darwin-27B-ZTC-v2가 102개 모델 중 1위를 차지했습니다. Borda 점수는 89.58점, 평균 과제 점수는 66.46점을 기록했습니다. 이 모델의 차별점은 결정 방식에 있습니다: 단 한 번의 순방향(forward pass)만으로 토큰을 생성하지 않습니다.
S1MB가 측정하는 것
S1MB는 타입화된 결정(typed decision)의 품질을 측정합니다. 각 항목은 하나의 조건과 선택지 집합을 제공하며, 모델은 올바른 선택지를 고르고 점수를 매겨야 합니다. 이는 텍스트 생성에 대한 벤치마크가 아니라, 순수한 결정에 대한 벤치마크입니다. 출력 결과는 타입화된 키(typed key)와 비교되므로, 모호한 문자열 일치나 두 번째 판정 모델 없이도 깔끔하고 재현 가능한 랭킹이 가능합니다.
토큰 제로가 우수한 이유
결정이 필요한 대부분의 시스템은 여전히 전체 생성 루프(generation loop)를 실행한 다음 텍스트를 파싱(parse)합니다. 이는 느리고, 비결정적이며, 생성되는 모든 토큰은 이탈할 기회를 제공합니다. 저희의 방법인 ZTC (Zero-Token Confidence)는 이를 생략합니다: 모델은 문제를 단 한 번의 순방향으로 읽고, 마지막 레이어의 은닉 상태(hidden state)를 가져와 보정된 프로브(calibrated probe)를 적용하여 결정을 직접 산출합니다.
# 단 한 번의 순방향, 토큰 생성 없음
h = model(text).last_hidden_state[last_non_pad_token]
score = ((h - mu) / sd) @ w # 보정된 프로브 -> 타입화된 결정
샘플링이 없기 때문에, 동일한 입력은 항상 동일한 결정을 내리며, 이는 측정 및 실제 운영 환경에서 원하는 바입니다.
결과
| 지표 | Darwin-27B-ZTC-v2 |
|---|---|
| S1MB 순위 | 102개 중 1위 |
| ... |
어디서 찾을 수 있나요
- S1MB 1위 모델: https://github.com/final-bench/s1mb
- ZTC 방법 및 코드: https://github.com/final-bench/ztc
- 가중치(Weights): https://huggingface.co/FINAL-Bench/Darwin-27B-ZTC-v2
자주 묻는 질문
S1MB란 무엇인가요?
타입화된 결정의 품질을 측정하는 벤치마크입니다. 주어진 조건과 후보 옵션에 대해 모델이 올바른 것을 선택하고 점수를 매깁니다.
어떤 모델이 최고인가요?
Borda 점수 89.58점, 102개 모델 중 평균 과제 점수 66.46점을 기록한 Darwin-27B-ZTC-v2입니다.
제로 토큰 결정이란 무엇인가요?
텍스트를 생성하지 않고 단일 전방향(forward pass)으로 도출되는 결정으로, 최종 은닉 상태에 보정된 프로브(probe)를 적용하여 결정론적(deterministic)이 됩니다.
오픈 소스인가요?
네, Apache-2.0 라이선스 하입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기