Decision Index 0.1 소개
요약
Decision Index를 통해 35개 이상의 벤치마크와 13만 개의 질문으로 오픈 웨이트 결정 모델들을 비교했습니다. jev가 전반적인 지식 면에서 여전히 선두지만, 도구 사용 및 자동화 분야에서는 근접한 경쟁을 보였습니다. Qwen3.8-27B나 fine-tuning된 Decider 35B-A3B 등 다양한 모델의 성능이 분석되었습니다.
핵심 포인트
- jev는 지식 기반 질문과 함수 선택, 도구 호출에서 강점을 보입니다.
- 도구 사용 및 자동화 분야에서는 jev를 추격하는 모델들이 근접한 성능을 보여줍니다.
- 벤치마크는 35개 이상의 카테고리에서 총 13만 개의 결정을 테스트했습니다.
- jev는 퍼즐, 문서 검색, 세밀한 감성 분석 등 일부 영역에서 약점을 보였습니다.
a rigorous leaderboard comparing jev with 30+ open weights decision models
35개 이상의 벤치마크를 통해 각 모델에 13만 개의 질문을 던졌습니다.
지식 🧠, 자동화 ⚙️, 이해 🤔 그리고 창의성 🎨까지 테스트합니다.
https://huggingface.co/spaces/multimodalart/jev-decision-index
…
jev가 전반적인 지식(아마도 더 큰 모델) 면에서 여전히 오픈 모델을 선도하고 있지만, 도구 사용/자동화/검색 및 분류 분야에서는 근접한 모습을 보입니다!
jev 바로 다음 모델들은 Qwen3.8-27B와 diffusion gemma의 원패스 추론(one-pass inference)이 가능한 추론 기법들로, 미세 조정(fine tuning)을 거치지 않았습니다.
3위는 Qwen3.5 35B base(!)를 강력하게 미세 조정(strong fine-tune)한 Decider 35B-A3B입니다.
모든 모델에 대해 5개 카테고리 전반에 걸쳐 37개의 벤치마크가 적용되었으며, 모델당 13만 개의 결정이 이루어졌습니다.
이 모든 테스트는 동일한 하드웨어(1x RTX 6000 PRO)에서 실행되었습니다.
이 벤치마크는 처음부터 포화 상태가 되지 않도록 비교적 도전적으로 설계되었습니다. jev가 다양한 작업 카테고리별로 어떻게 수행하는지입니다.
secially good for tools and automation (makes sense!)
jev는 여전히 체스 같은 퍼즐 및 추론 게임에서는 어려움을 겪습니다. 또한, 슈퍼 하드한 문서 검색 작업(일반적으로 추론 모델이 필요함), 음악 음표로부터 코드 인식, 그리고 세밀한 감성 분석에서도 아주 좋은 성능을 보이지 못했습니다.
jev는 학부 수준까지의 지식 기반 질문, python 함수 선택, 도구 호출 및 모델 라우팅에서 특히 뛰어난 성능을 보입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: Benchmark의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기