순수 오픈 웨이트 모델 벤치마크
요약
본 글은 DeepSeek-V4-Vision-Exp 규칙을 따르면서도 다양한 도메인, 언어, 의도를 포괄하는 오픈 웨이트 모델의 벤치마크 결과를 공유합니다. 코딩 및 에이전트적(agentic) 벤치마크를 포함하며, 로컬 환경에서 누구나 평가에 참여할 수 있도록 공개되었습니다.
핵심 포인트
- 오픈 웨이트 모델의 도메인/언어별 성능을 종합적으로 비교 가능
- 코딩 및 에이전트적 검색 등 고급 기능에 대한 벤치마크 제공
- 로컬 PC 환경에서 직접 모델 평가 및 참여가 가능함
- 커뮤니티 기여를 통해 벤치마크의 완성도를 높일 계획
실시간 결과, 코딩 벤치마크 포함, 에이전트적(agentic) 벤치마크 포함. (스포일러: DeepSeek-V4-Vision-Exp 규칙을 따르지만, 다른 모델들도 자체적인 영역의 규칙을 가짐): https://beta.locallm.top 도메인 전문가들(주로 친구들이 평가함; 코딩 부분은 제가 전적으로 평가함)에 의해 평가되었으며, 도메인/언어/의도별로 분류됨 (홈페이지에서 필터링 가능), 에이전트적 코딩 벤치마크가 포함되어 있습니다. 이것은 데이터의 공개된 부분일 뿐입니다 (개인적인 질의를 가지고 모델을 평가한 사람은 결과를 다르게 볼 것입니다). 현재 존재하는 수많은 한계점들: 도메인/신규 모델에 대한 평가/질문 커버리지가 불완전하고 불균형하며, 질문 중 일부만 분류되었고, UI/UX가 미흡하게 개발되었습니다. 초점은 소규모 모델과 낮은 양자화(lower quants)에 맞춰져 있었습니다. 또한: 모든 것은 로컬 2xRTX 3090 + 128GB RAM PC에서 실행되며, 누구나 질의를 생성하고 모델의 답변을 평가할 수 있습니다. 새로운 실행 결과 (특히 에이전트적)는 나타나는 데 시간이 걸립니다 (PC 사양 참조). 의도적으로 LLM-as-judge 방식은 사용하지 않았습니다 (가끔 후회하기도 합니다). 현재 확장 및 평가 중인 벤치마크: 1) 에이전트적 코딩 2) 원샷(one-shot) 코딩 3) 에이전트적 검색(retrieval) 4) 에이전트적 스토리 작성. 평가 중인 신규 모델: 1) Qwen3.8-27B (언센서드). 곧 평가될 예정인 신규 모델: 1) GLM-5.3-Flash-UD-IQ3XSS 2) Mellum2.1-12B-A2.5B 이것이 흥미롭다면: 도움 요청 저는 커뮤니티 벤치마크를 구축하고자 하는 개발자 및 도메인 전문가들 모두에게 도움을 요청합니다! 조만간 많은 것들이 구현될 것이며, 에이전트적 벤치마크는 시작에 불과합니다. 다음 영역에서 도움을 요청합니다: 1) 컴퓨팅 자원 2) 평가 작업 3) 개발 - 기본적으로 모든 것. 하지만 어떤 제안과 피드백이라도 소중합니다! 저는 댓글 섹션에서 더 많은 정보를 추가하고 질문에 답할 것입니다. P.S. 이 게시물을 작성하는 데 AI는 사용되지 않았습니다 (비록 영어가 사실 저의 모국어는 아니지만 /s). 제출자: /u/EmilPi [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기