
NVIDIA DGX Spark에서 소프트웨어 개발에 최적화된 Gemma 4 모델 검증 (31B vs 26B)
요약
NVIDIA DGX Spark 환경에서 Gemma 4 31B와 26B 모델의 소프트웨어 개발 성능을 비교 검증한 연구 결과입니다. HumanEval과 GSM8K 벤치마크를 통해 코딩 능력과 논리적 추론 능력을 정량적으로 평가했습니다.
핵심 포인트
- Gemma 4 31B와 26B 모델의 개발 최적성 비교
- HumanEval을 통한 Python 코딩 능력 검증
- GSM8K를 통한 논리적·수학적 추론 능력 측정
- vLLM 및 NeMo Evaluator를 활용한 검증 환경 구축
NVIDIA DGX Spark 환경에서 소프트웨어 개발의 파트너로서 최적인 Gemma 4 모델은 무엇인가.
그 의문을 해소하기 위해, nvidia/Gemma-4-31B-IT-NVFP4와 nvidia/Gemma-4-26B-A4B-NVFP4 두 모델에 대해 벤치마크 (Benchmark)를 실시했습니다.
검증 환경
본 검증에서는 소프트웨어 개발에서의 주요 태스크 (Task, 코딩 능력 및 논리적 추론 능력)를 평가하기 위해 다음과 같은 구성으로 벤치마크를 수행했습니다.
하드웨어: Lenovo ThinkStation PGX (NVIDIA DGX Spark의 OEM 버전) -
추론 엔진 (Inference Engine): vLLM (Docker Compose 사용) -
평가 도구 (Evaluation Tool): NeMo Evaluator (Docker Compose 사용)
NeMo Evaluator에 대하여
NeMo Evaluator는 대규모 언어 모델 (LLM)의 성능을 다각적으로 평가하기 위한 도구입니다. 수학, 코딩, 독해, 지식, 안전성 등 다양한 분야의 벤치마크를 실행하여 모델의 능력을 정량적으로 측정할 수 있습니다.
NeMo Evaluator로 실행 가능한 주요 벤치마크
NeMo Evaluator에는 다음과 같은 다양한 벤치마크가 내장되어 있습니다.
| 벤치마크 | 분류 | 내용 |
|---|---|---|
| MMLU / MMLU-Pro | 다지선다 | 광범위한 지식 (57개 과목)에 기반한 이해력 |
| GSM8K | 수학 | 초등학교 수준의 산수에서의 다단계 추론 |
| HumanEval | 코딩 | Python을 이용한 함수 보완 능력 (Docker를 통한 실행 검증) |
| MATH-500 | 수학 | 고도의 수학적 문제 해결 능력 |
| GPQA Diamond | 과학 | 전문가 수준의 과학적 지식 |
| DROP | 독해 | 이산적인 추론을 필요로 하는 독해 태스크 |
| TriviaQA | 사실 확인 | 일반적인 지식에 관한 질문 답변 |
| SimpleQA | 사실성 | LLM judge에 의한 사실 관계의 정확성 평가 |
이번 검증에서 사용한 벤치마크 상세
본 검증에서는 특히 소프트웨어 개발과 직결되는 다음 두 가지 벤치마크에 초점을 맞추었습니다.
| 벤치마크 | 내용 | 스코어링 (Scoring) 방법 |
|---|---|---|
| HumanEval | 164개의 Python 함수 보완 문제. 코딩 능력을 측정. | code_sandbox: 코드를 Docker 컨테이너 내에서 실행하여 테스트 결과로 판정. |
| GSM8K | 1,319개의 초등학교 수준 산수 문제. 논리적·수학적 추론 능력을 측정. | numeric_match: 답변에서 수치를 추출하여 정답과 비교. |
실행 절차
0. NeMo Evaluator 설치
먼저, uv를 사용하여 NeMo Evaluator의 실행 환경을 구축합니다.
# 리포지토리 (Repository) 클론 및 이동
git clone https://github.com/NVIDIA-NeMo/Evaluator.git
cd Evaluator
...
1. 환경 변수 설정
모델 로드 및 vLLM 기동을 위해 다음 환경 변수를 설정합니다.
export LATEST_VLLM_VERSION=26.06-py3
export HF_TOKEN="<YOUR_HF_TOKEN>"
# 평가할 모델에 맞춰 설정
...
2. vLLM 기동
docker-compose.yml을 준비하고 vLLM 서버를 기동합니다.
services:
vllm:
image: nvcr.io/nvidia/vllm:${LATEST_VLLM_VERSION}
...
3. NeMo Evaluator를 통한 벤치마크 실행
다음으로 설정 파일을 준비하고, 아래 절차에 따라 벤치마크를 실행합니다.
설정 파일 작성
먼저, 다음 내용으로 eval_config.yaml을 작성합니다.
services:
local_vllm:
type: api
...
기존 결과 리셋
벤치마크를 시작하기 전에, 이전 실행 결과가 남아 있는 경우 삭제해 둡니다.
rm -rf eval_results
벤치마크 시작
다음 명령어를 실행하여 벤치마크를 시작합니다.
nel eval run eval_config.yaml
결과 정리
벤치마크 완료 후, 모델별로 결과를 정리하기 위해 전용 디렉토리를 생성하고 결과를 이동합니다.
mkdir -p "eval_results_all/${HF_MODEL_HANDLE}"
mv eval_results/* "eval_results_all/${HF_MODEL_HANDLE}/"
비교 모델
| 모델명 | Hugging Face URL |
|---|---|
nvidia/Gemma-4-31B-IT-NVFP4 | [Link] |
nvidia/Gemma-4-26B-A4B-NVFP4 | [Link] |
벤치마크 결과
1. 정확도 평가 (Score)
NeMo Evaluator에 의한 평가 결과는 다음과 같습니다.
| 모델 | Benchmark | Score (pass@1) |
|---|---|---|
| Gemma-4-31B-IT-NVFP4 | humaneval | 0.9817 |
| gsm8k | 0.9257 | |
| Gemma-4-26B-A4B-NVFP4 | humaneval | 0.9878 |
| gsm8k | 0.9219 |
참고: humaneval에서는 26B 모델이 약간 높은 점수를 기록했으나, gsm8k에서는 31B 모델이 앞서고 있습니다. 전체적인 정확도 차이는 매우 미미합니다.
2. 추론 속도 (Tokens/sec)
각 벤치마크 실행 시의 로그에서 산출한 실효 속도는 다음과 같습니다.
| 모델 | 평가 태스크 | 총 처리 시간 | 총 토큰 수 | 실효 속도 |
|---|---|---|---|---|
| Gemma-4-31B-IT-NVFP4 | humaneval | 1373.9s | 62,720 | 45.65 tok/s |
| gsm8k | 14261.2s | 505,873 | 35.47 tok/s | |
| Gemma-4-26B-A4B-NVFP4 | humaneval | 358.1s | 67,626 | 188.85 tok/s |
| gsm8k | 4135.5s | 584,850 | 141.42 tok/s |
고찰 및 결론
벤치마크 결과로부터 다음을 알 수 있습니다.
- 정확도 측면: 두 모델 모두 매우 높은 성능을 보유하고 있으며, 소프트웨어 개발에 필요한 코딩 능력 (
humaneval) 및 추론 능력 (gsm8k)에 있어 실용적인 차이는 거의 느껴지지 않는 수준입니다. - 속도 측면: Gemma-4-26B-A4B-NVFP4가 압도적으로 빠릅니다. 31B 모델과 비교하여 약 4배 정도의 처리량 (Throughput)을 실현하고 있습니다.
결론
NVIDIA DGX Spark에서 소프트웨어 개발에 이용할 경우, "응답 속도와 효율"을 중시한다면 nvidia/Gemma-4-26B-A4B-NVFP4가 최적의 선택지가 됩니다.
반면, 극한까지 정확도를 추구하고 싶거나 향후 모델 스케일 업에 따른 미세한 성능 향상을 기대하는 경우에는 31B 모델도 선택지에 포함될 수 있으나, 개발 경험(대화형 인터랙션 등)을 고려하면 26B 모델의 압도적인 응답 속도는 매우 강력한 무기가 될 수 있습니다.
Discussion

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기