Glimmer 30B DFlash 로컬 벤치마크 결과 (RTX 3060 12GB + RTX 3070 8GB)
요약
본 글은 Glimmer 30B 모델을 RTX 3060 12GB와 RTX 3070 8GB 조합의 하드웨어 환경에서 llama.cpp를 사용하여 로컬로 테스트한 벤치마크 결과를 공유합니다. 프롬프트 처리 속도(평균 684.86 t/s)와 생성 속도(평균 41.97 t/s) 등 구체적인 성능 지표를 제시하여, 유사 환경의 사용자들에게 참고 자료를 제공하는 것이 목적입니다.
핵심 포인트
- Glimmer 30B 모델을 로컬에서 테스트한 실제 벤치마크 결과 공유
- RTX 3060 + RTX 3070 조합의 성능 지표 제시 (VRAM 사용량 포함)
- llama.cpp와 llama-server를 활용한 구체적인 설정 및 측정값 제공
저의 현재 환경에서 Glimmer 벤치마크를 찾으려고 했지만, 자료가 많지 않아 다른 분들이 참고하실 수 있도록 제가 테스트한 결과를 공유하려고 합니다.
하드웨어: Ryzen 5 5600X, DDR4 48 GB, RTX 3060 12 GB, RTX 3070 8 GB (총 VRAM 20 GB)
운영체제: Windows
사용 프로그램: llama.cpp / llama-server
모델 정보: Glimmer 30B IQ4_XS
작성 시점: Draft: Glimmer 30B DFlash Q4_0 DFlash draft model on CUDA1
레이어 분할: 45/55
컨텍스트 설정: 65,536 토큰
K/V 캐시: Q8_0 Flash Attention: on DFlash
최대 드래프트: 15
벤치마크 프롬프트 자체는 994 토큰이었으므로, 이 결과가 65K 컨텍스트로 채워진 상태의 벤치마크는 아닙니다. 서버는 65,536 토큰의 컨텍스트 창으로 설정되었습니다.
결과:
- 프롬프트: 994 토큰
- 출력: 128 토큰
- 프롬프트 처리 속도 (Prompt processing): 평균 684.86 t/s
- 생성 속도 (Generation): 평균 41.97 t/s
- 생성 범위: 41.71–42.45 t/s
- 평균 총 요청 시간: 4.5초
- 모델 로드 시간: 9.7초
- VRAM 사용량: GPU 0: 11,229 MiB, GPU 1: 6,627 MiB (합산 관찰 사용량: 약 17.4 GiB)
저는 이 테스트에서 모든 토큰/초를 짜내려고 한 것은 아닙니다. 단지 제가 사용하게 된 설정과 그에 따른 성능일 뿐입니다. 혼합된 3060 12GB + 3070 8GB 환경에서 Glimmer 관련 자료를 찾기 어려웠기에, 부디 다른 분들에게 유용한 참고 자료가 되기를 바랍니다.
`llama-server.exe ^ -m
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기