4090 + 5060 Ti + 64GB RAM: 35B-A3B에서 206 t/s, 122B에서 37 t/s 달성
요약
RTX 4090과 RTX 5060 Ti를 조합한 듀얼 GPU 환경에서 llama.cpp를 활용한 LLM 추론 성능 벤치마크 결과입니다. 35B-A3B 모델에서 최대 206 t/s, 122B 모델에서도 시스템 RAM 활용을 통해 37-41 t/s의 높은 속도를 달성했습니다.
핵심 포인트
- RTX 4090과 5060 Ti 조합으로 대규모 모델 추론 성능 최적화
- CUDA 12.8 버전 사용 시 Blackwell 아키텍처에서의 세그멘테이션 오류 방지 가능
- 122B 모델의 레이어를 시스템 RAM에 분산 배치하여 기대 이상의 속도 확보
- llama.cpp 실행 플래그 및 최적화 설정을 통한 성능 극대화
몇 주 동안 듀얼 카드 박스를 벤치마킹해 왔는데, 이 수치들 중 일부는 여전히 믿기지 않아서 여기에 쏟아내 봅니다. 박스 사양: RTX 4090 (24GB) + RTX 5060 Ti (16GB), i9-13900K, 64GB DDR5. VM에 47GB를 할당한 WSL2, CUDA 12.8 (정확히 12.8 버전입니다. 13.1 버전은 Blackwell에서 llama.cpp의 MMQ 커널에 세그멘테이션 오류(segfault)를 일으키고 조용히 cuBLAS로 폴백(fallback)되는데, 이를 알아내기 전까지 프롬프트 처리 속도가 약 6배나 느려졌습니다). llama.cpp는 89;120용으로 빌드되었습니다. 아래 모든 수치는 q8_0 KV 캐시를 사용한 131K 컨텍스트 기준이며, 짧은 코드 생성(short-code generation)을 통해 측정되었습니다.
| 모델 | 배치(Placement) | MTP On | MTP Off |
|---|---|---|---|
| Qwen3.6-27B dense, Q4_K_XL | 4090 단독 | 101–118 t/s | 44 t/s |
| Qwen3.6-27B dense, Q6_K_XL | 두 카드 모두 사용, 레이어 분할(layer split) | 64 t/s | |
| Qwen3.6-35B-A3B, Q4_K_XL | 4090 + 5060 Ti (6개 전문가 레이어 스필/spilled) | 206 t/s | 113 t/s |
| Qwen3.5-122B-A10B, IQ3_S | 4090 + 5060 Ti + RAM 내 약 15GB | 37–41 t/s | 24 t/s |
122B 모델은 제가 계속 다시 읽게 되는 수치입니다. 49개의 레이어 중 17개가 시스템 RAM에 상주하는 1,220억 파라미터 모델임에도 불구하고, 대부분의 사람들이 사용하는 8B 설정보다 빠르게 생성합니다. 실행하기 전 제가 대략적으로 계산했을 때는 20–30 t/s 정도였고, 그조차 낙관적인 수치라고 생각했습니다. 스크립트와 모든 원시 수치는 제가 올린 리포지토리(github.com/04RR/qServer)에 있습니다. 대단한 기술이라기보다는 대부분 llama.cpp 실행 플래그(launch flags)와 회귀 게이트(regression gates)를 활용한 저만의 방식이지만, 혹시라도 지저분한 세부 사항까지 알고 싶은 분들을 위해 RESULTS 및 LEARNINGS 파일에 전체 스윕(sweeps) 데이터를 넣어두었습니다 (물론 Claude 코드로 생성되었습니다).
/u/Dry_Long3157이 r/LocalLLaMA에 게시함 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기