22개의 NVIDIA NIM 모델 커뮤니티 기반 벤치마킹 시스템
요약
NIMStats는 GitHub Actions를 활용하여 22개의 NVIDIA NIM 모델을 매시간 자동으로 벤치마킹하고 그 결과를 인터랙티브 대시보드로 제공하는 오픈 소스 프로젝트입니다. 별도의 인프라 비용 없이 포크만 하면 누구나 쉽게 자체 호스팅할 수 있습니다. 이 시스템은 개요, 리더보드, 탐색기 등 다양한 탭을 통해 모델의 성능 지표를 심층적으로 분석하고, 공개 API 엔드포인트를 제공하여 외부 애플리케이션과의 통합도 용이합니다.
핵심 포인트
- 22개 NVIDIA NIM 모델에 대한 자동화된 커뮤니티 벤치마킹 시스템입니다.
- GitHub Actions와 정적 사이트 기술을 사용하여 인프라 비용 없이 자체 호스팅 가능합니다.
- 성능, 처리량, 지능 등 다양한 카테고리별로 상세한 데이터를 제공하는 API를 갖추고 있습니다.
22개의 NVIDIA NIM 모델에 대한 커뮤니티 주도 벤치마킹 — 완전 자동화, 무(無) 인프라 비용, 몇 분 만에 자체 호스팅 가능.
🚀 라이브 대시보드 보기 · 📖 문서 · 🤝 기여하기 · 💬 토론하기
NIMStats는 GitHub Actions를 사용하여 22개의 NVIDIA NIM 모델을 매시간 자동으로 벤치마킹하고, 그 결과를 아름답고 인터랙티브한 대시보드에 게시합니다. 서버나 구독이 필요 없습니다 — 포크(fork)만 하고 API 키를 추가하면 바로 사용 가능합니다.
| 🏎️ 시간별 벤치마크 | 📊 인터랙티브 차트 | 🔁 제로 인프라 | 🌍 완전 오픈 소스 |
|---|---|---|---|
| GitHub Actions를 통한 자동화 | 응답 시간, 처리량 및 트렌드 | 정적 사이트 + 무료 CI/CD | 몇 분 만에 포크하여 자체 호스팅 |
5분 이내에 자신만의 벤치마킹 대시보드를 실행해 보세요.
git clone https://github.com/MauroDruwel/NIMStats.git
cd NIMStats
build.nvidia.com을 방문 → 무료 계정 생성 → API 키 복사.
포크한 리포지토리에서: Settings → Secrets and variables → Actions → New repository secret
| 이름 | 값 |
|---|---|
NIM_API_KEY | 귀하의 NVIDIA NIM API 키 |
| 플랫폼 | 단계 |
|---|---|
| Cloudflare Pages | 리포 연결 → main에 푸시할 때마다 자동 배포 |
| GitHub Pages | Settings → Pages → main에서 배포 |
| Netlify / Vercel | 즉각적인 자동 배포를 위해 리포 연결 |
Actions → Benchmark NVIDIA NIM Models → 워크플로우 실행
그게 전부입니다 — 대시보드가 매시간 자동으로 새로 고침됩니다. ✨
| 탭 | 제공되는 내용 |
|---|---|
| 📊 개요 (Overview) | 5개의 애니메이션 KPI 카드 · 성공 추세 차트 · 상위 10개 속도 및 처리량 막대 그래프 · 모델 신뢰성 표시제(pills) |
| 🏆 리더보드 (Leaderboard) | 종합 점수 순위 · 정렬 가능한 열 · SVG 스파크라인 · 추세 지표 (↑↓→) · 제공업체 칩 |
| 🔬 탐색기 (Explorer) | 모델별 심층 분석 · 응답 시간 기록 차트 · 오류 분류 도넛 그래프 · 가용성 히트맵 |
| ⏱ 타임라인 (Timeline) | 필터링 가능한 실행 기록 (전체/24시간/48시간/7일) · 전체 모델 상세 정보가 포함된 확장 가능 실행 카드 |
| ⚔️ 비교 (Compare) | 대결 오버레이 차트 · 승률 통계 · 나란히 배치된 지표 비교 |
| 🔗 공개 API (Public APIs) | 여러 카테고리 엔드포인트: /top (균형), /top/speed (속도 및 tps), 그리고 /top/intelligence (기능). JSON 형식과 원시 .txt 형식 모두 지원. 로컬 스크립트, 프로그램 또는 앱과의 통합에 완벽함 |
NIMStats는 다양한 성능 카테고리에서 최고의 모델을 조회하기 위한 경량의 정적 API 엔드포인트를 제공합니다. 시간별 벤치마크가 완료될 때마다 이 엔드포인트들이 업데이트됩니다.
| 카테고리 | 엔드포인트 (JSON) | 엔드포인트 (일반 텍스트) | 점수 배분 균형 |
|---|---|---|---|
| ⚖️ 균형 (Balanced/전체) | /top | /top/model | 30% 가동 시간(Uptime) + 30% 지능(Intelligence) + 20% 평균 시간(Avg Time) + 20% 처리량(Throughput) |
| 🏎️ 속도 및 처리량 (Speed & Throughput) | /top/speed | /top/speed/model | 50% 평균 응답 시간(Avg Response Time) + 50% 처리량(TPS) |
| 🧠 모델 지능 (Model Intelligence) | /top/intelligence | /top/intelligence/model | 70% 인공 분석 점수(Artificial Analysis Score) + 30% 가동 시간(Uptime) |
{
"best_model": "nvidia/nemotron-3-nano-omni-30b-a3b-reasoning",
"provider": "nvidia",
...
11개 제공업체의 22개 모델 — 클릭하여 확장
| Provider | Model | Highlight |
|---|---|---|
| DeepSeek | deepseek-ai/deepseek-v4-flash | Fast MoE, 속도 최적화 |
| DeepSeek | deepseek-ai/deepseek-v4-pro | 전문 수준 추론 |
| Z-AI | z-ai/glm-5.2 | 우수한 코드 이해 |
| MiniMax | minimaxai/minimax-m2.7 | 효율적인 추론 모델 |
| MiniMax | minimaxai/minimax-m3 | 최신 MiniMax 세대 |
| NVIDIA | nvidia/nemotron-3-super-120b-a12b | NVIDIA의 120B 플래그십 |
| NVIDIA | nvidia/nemotron-3-nano-omni-30b-a3b-reasoning | 컴팩트한 범용 추론 모델 |
| NVIDIA | nvidia/llama-3.3-nemotron-super-49b-v1.5 | Nemotron Super 49B v1.5 |
| Moonshot | moonshotai/kimi-k2.6 | 컨텍스트 최적화 모델 |
| OpenAI | openai/gpt-oss-120b | 오픈 소스 120B |
google/gemma-4-31b-it | 경량 에지 추론 | |
| Qwen | qwen/qwen3.5-397b-a17b | 플래그십 Qwen (397B) |
| Qwen | qwen/qwen3.5-122b-a10b | 중급 Qwen 3.5 MoE |
| Qwen | qwen/qwen3-next-80b-a3b-instruct | 차세대 Qwen (80B MoE) |
| Mistral | mistralai/mistral-large-3-675b-instruct-2512 | 최대 규모 Mistral (675B) |
| Mistral | mistralai/mistral-medium-3.5-128b | 효율적인 중규모 Mistral |
| Mistral | mistralai/mistral-small-4-119b-2603 | Mistral Small 4 (119B) |
| Meta | meta/llama-3.3-70b-instruct | Llama 3.3 70B |
| Meta | meta/llama-4-maverick-17b-128e-instruct | Llama 4 Maverick (128 experts) |
| Meta | meta/llama-3.2-90b-vision-instruct | 멀티모달 90B 비전 모델 |
| StepFun | stepfun-ai/step-3.5-flash | 초고속 플래시 모델 |
| StepFun | stepfun-ai/step-3.7-flash | 최신 고성능 플래시 |
┌──────────────────── GitHub Actions (every hour) ──────────────────────┐
│ │
┌─────────────────────┐ ┌─────────────────────┐ │
...
병렬 작업(Parallel jobs) = ~50% 더 빠른 벤치마크 ⚡
벤치마크 프롬프트 변경하기
PROMPT 수정
in scripts/test_models.py
:
`PROMPT =
DB에 모델 목록 나열 vs test_models.py
python scripts/manage_models.py list
ALL_MODELS에 새 모델 추가
...
또는 수동으로 편집합니다.
scripts/test_models.py 내의 ALL_MODELS:
ALL_MODELS = [
"your/custom-model",
# ...
...
스케줄 변경하기
.github/workflows/benchmark.yml을 편집합니다.
:
`- cron: '0 */6 * * *' # 매시간 대신 6시간마다 실행
로컬에서 실행하기
# 대시보드 제공
python3 -m http.server 8000
# http://localhost:8000 열기
...
history.db는 리포지토리에 영구 저장되는 SQLite 데이터베이스이며, 단일 진실 공급원(single source of truth)입니다. 브라우저는 이를 sql.js (WebAssembly)를 통해 로드하고 클라이언트 측에서 전체 쿼리를 수행합니다. scripts/results.json은 커밋되지 않는 임시적인 작업별 아티팩트입니다.
스키마 구조:
CREATE TABLE prompts (
id INTEGER PRIMARY KEY,
text TEXT UNIQUE
...
벤치마크 매개변수 (기본값): temperature: 0.7
· top_p: 0.9
· max_tokens: 500
· OpenAI와 호환되는 API. GLM-5.3 계열은 사고(thinking)가 항상 활성화되어 있기 때문에 reasoning_effort: low 및 max_tokens: 2048을 사용합니다.
기여는 오픈 소스 커뮤니티를 놀랍게 만드는 요소입니다. 여러분이 하는 모든 기여는 매우 감사하게 생각됩니다!
리포지토리 포크(Fork)- 기능 브랜치 생성:
git checkout -b feat/amazing-feature
-
변경 사항 커밋:
git commit -m 'feat: add amazing feature' -
브랜치에 푸시:
git push origin feat/amazing-feature -
풀 리퀘스트(Pull Request) 열기
기여 아이디어:
- 🆕 벤치마크 목록에 새로운 NIM 모델 추가
- 📊 새로운 차트 유형 또는 대시보드 위젯
- 🌐 국제화 / 번역
- 🐛 버그 수정 및 성능 개선
- 📖 문서 개선
시작하기 전에 열려 있는 이슈(Issues)를 읽어보세요. 이미 누군가 작업하고 있을 수도 있습니다!
- NVIDIA NIM API Documentation
- NVIDIA Model Catalog
- GitHub Actions Docs
- sql.js — 브라우저의 SQLite
MIT 라이선스에 따라 배포됩니다. 자세한 내용은 LICENSE를 참조하세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 GitHub AI Research의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기