로그릿에서 모든 허용 레이블을 점수화하는 Pecision 모델: Jebadiah v2.1 (27B, 9B), 오픈 가중치 및 자체 실행
요약
Jebadiah v2.1 모델은 텍스트 생성 대신 폐쇄 집합 점수화 방식을 채택하여, 구조화된 컨텍스트와 고정 옵션 세트를 가진 질문에 대한 확률적 출력을 제공합니다. 이 오픈 가중치 모델은 27B 및 9B 버전으로 업데이트되었으며, 다양한 지식 영역에서 성능 향상을 보여주었습니다.
핵심 포인트
- Jebadiah v2.1은 폐쇄 집합 점수화 문제에 특화된 오픈 모델입니다.
- 27B와 9B 버전이 업데이트되어 공개되었습니다.
- 지식, 언어, 검색 등 여러 영역에서 성능 개선을 확인했습니다.
- 모델 가중치 및 평가 결과는 Hugging Face와 GitHub를 통해 공개됩니다.
저는 결정을 텍스트 생성(text generation)이 아닌 폐쇄 집합 점수화 문제(closed-set scoring problem)로 다루는 오픈 모델들을 구축해 왔습니다. 입력은 구조화된 컨텍스트와 고정된 옵션 세트를 가진 유형화된 질문으로 구성됩니다. 출력은 후보 레이블 로그릿(candidate-label logits)에서 가져온 각 옵션의 확률이며, 파싱할 생성 단계나 샘플링 과정이 없습니다. v2.1에서는 27B와 9B를 업데이트했습니다.
Decision Index 0.3 공개 스위트(공식 점수 측정기(official scorer)가 변경되지 않은 상태로 제가 직접 실행한 결과이며, 순위를 매기기 전에 사설 테스트를 추가하는 보드에 제출됨):
- 27B: 57.03 vs 55.11 (v2). 지식(Knowledge) +2.34, 언어(Language) +3.89, 검색(Retrieval) +2.81, 예술(Arts) +1.31, 도구(Tools) -2.10
- 9B: 47.20 vs 44.09. 지식(Knowledge) +3.67, 언어(Language) +4.34, 검색(Retrieval) +5.96, 예술(Arts) +0.01, 도구(Tools) -0.84
회귀 현상(regressions)은 특정 영역에 집중되었습니다: When2Call이 6.38 (27B) 및 7.44 (9B) 하락했습니다. 아직 원인을 찾지 못했으며, 이 변화들 중 어떤 것도 통계적 유의미성(statistical significance)을 주장하지는 않습니다.
오염 검사(Contamination check): 공개 학습 출처와 겹치는 벤치마크 패밀리들은 학습 데이터와 비교되었으며, 일치하는 부분이 전혀 없었습니다. 이는 텍스트 매치 스캐너이므로, 의역된 중복은 통과할 수 있습니다.
양자화(Quantization): 저는 빌드당 260개의 보류 질문(held-out questions)에 대해 전체 가중치(full weights)와의 일치도를 측정했습니다 (예: 27B Q8_0 259/260, 9B MLX 4-bit 237/260) 그리고 질문별 기록을 공개합니다. 가중치(Apache-2.0, Qwen base): https://huggingface.co/frontier-infra/jebadiah-27b-v2-1 및 https://huggingface.co/frontier-infra/jebadiah-9b-v2-1
결과: https://huggingface.co/datasets/frontier-infra/jebadiah-v2-1-decision-index-results
코드 및 평가(Code and evals): https://github.com/getainode/jebadiah
평가 설정, 특히 도구 사용 회귀 현상에 대한 비판을 환영합니다.
제출자: /u/WebDevToday [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/MachineLearning (hot)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기