
TensorSharp, GGUF 모델을 위한 멀티 GPU 텐서 병렬 처리(Tensor Parallelism) 지원
요약
오픈 소스 .NET 추론 엔진인 TensorSharp가 GGUF 모델을 위한 멀티 GPU 텐서 병렬 처리(Tensor Parallelism) 기능을 지원합니다. CUDA, Vulkan, Metal 등 다양한 백엔드를 통해 여러 GPU에 걸친 효율적인 모델 실행을 지원합니다.
핵심 포인트
- GGUF 모델을 위한 멀티 GPU 텐서 병렬 처리 지원
- CUDA, Vulkan, Metal 및 멀티 노드 설정 지원
- PCIe 환경에서도 NVLink 없이 텐서 병렬 처리 가능
- Gemma 4 및 Qwen 모델에 대한 성능 향상 확인
- DeepSeek V4 지원 예정
TensorSharp는 CUDA, Vulkan, Metal, OpenAI 호환 API, 연속 배치(continuous batching), 투기적 디코딩(speculative decoding) 및 멀티모달(multimodal) 지원을 갖춘, GGUF LLM을 로컬에서 실행하기 위한 오픈 소스 네이티브 .NET 추론 엔진입니다. 이제 TensorSharp는 여러 GPU에 걸친 Megatron 스타일의 텐서 병렬 처리 (tensor parallelism)를 지원합니다. 이는 direct CUDA, GGML CUDA, GGML Vulkan 및 멀티 노드(multi-node) 설정에서 작동합니다. NVLink 없이 PCIe를 통한 2× RTX 2000 Ada 16 GB GPU에서의 벤치마크 결과는 다음과 같습니다: 모델 | 1 GPU Prefill / Decode | TP=2 Prefill / Decode
Gemma 4 E4B Q8_0 | 2760 / 37.3 tok/s | 2488 / 51.7 tok/s
Gemma 4 26B-A4B IQ4_XS | 1845 / 48.5 tok/s | 2537 / 51.2 tok/s
Qwen 3.5 9B Q8_0 | 1461 / 23.1 tok/s | 399 / 24.4 tok/s
Qwen 3.5 35B-A3B IQ4_XS | 용량 부족 (Does not fit) | 184 / 18.1 tok/s
멀티 GPU 시스템에서 Qwen 성능을 최적화하는 작업을 계속하고 있으며, DeepSeek V4 지원도 곧 추가될 예정입니다. 다음과 같이 시도해 보세요: TensorSharp.Cli --model model.gguf --backend ggml_cuda --tp 2
GitHub: https://github.com/zhongkaifu/TensorSharp
TensorSharp를 확인해 주시고 프로젝트에 스타(star)를 눌러주셔서 감사합니다! 모든 피드백은 정말 큰 도움이 됩니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기