Show GN: oh-my-jev - Jev-Style 판단 모델을 벤치마크하고 테스트하고 직접 파인튜닝까지 가능한 오픈소스 도구
요약
oh-my-jev는 판단 모델(Judgment Model)을 위한 통합 오픈소스 도구입니다. 이 CLI와 웹 UI를 통해 로컬 및 원격 API에서 여러 판단 모델을 서빙, 비교, 학습할 수 있습니다. 특히 정확도 외에 ECE, Brier 등의 보정 지표로 성능을 분석하고 LoRA/QLoRA 방식으로 미세 조정하는 기능을 제공합니다.
핵심 포인트
- 판단 모델(Judgment Model) 전용 통합 오픈소스 도구입니다.
- 서빙, 비교, 학습이 가능한 CLI와 웹 UI를 제공합니다.
- ECE, Brier 등 보정 지표로 성능을 심층 분석할 수 있습니다.
- LoRA/QLoRA 방식으로 미세 조정 및 테스트가 가능합니다.
소개
- 판단 모델이란 "어느 팀으로 보낼까", "규정 위반인가" 같은 정해진 질문에 문장 대신 선택지별 확률로 답하는 모델임. TypeSafe의 Jev가 대표적이고, 공개 이후 오픈 복제 모델이 빠르게 늘어남
- oh-my-jev는 이런 모델을 한곳에서 서빙, 비교, 학습하는 CLI와 웹 UI임(Apache-2.0)
주요 기능
- omj serve: 로컬 오픈 가중치, 원격 API, mock 위에 TypeSafe 호환 /v1/systemone 엔드포인트를 띄움. 공식 SDK에서 base_url만 바꾸면 연결됨
- omj bench: 정확도와 함께 보정(ECE, Brier, 위험 5% 기준 커버리지), 95% 신뢰구간, 태그별 약점을 보고함. 모든 결과를 Jev 1.13과 나란히 비교함
- omj train: JSONL 파일 하나와 TOML 레시피로 LoRA/QLoRA 미세조정. 레이블 한정 교차엔트로피에 Brier 항을 더해 보정까지 학습함
- omj ui: 같은 상황을 여러 모델에 보내 확률과 임계값 정책 판정을 비교하는 웹 플레이그라운드, 실행 리포트 화면
- 로컬 모델은 선택지 레이블 로짓을 순전파 1회로 읽음. 문장을 생성하지 않음
- mock 백엔드가 있어 GPU나 API 키 없이 모든 명령을 먼저 돌려 볼 수 있음
내장 벤치마크
- JevBench 공개 231문항, MASSIVE 1.1 한국어/영어 고정 표본(한영 격차 측정), 분포 밖 holdout, 정답 없는 문항(과신 측정), 선택지 순서 견고성
참고
- Windows 11, Linux에서 확인(Linux 테스트 594건 통과). macOS는 미검증
- TypeSafe AI와 제휴하거나 보증받은 프로젝트가 아님. 호환 인터페이스를 구현한 독립 프로젝트임
- 모델: https://huggingface.co/corners-ai/CoCo-Decision-4B-Ko
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기