나의 듀얼 5060 Ti 설정이 왜 사용률 50%를 넘지 못하는지에 대해 알게 된 점 (고장 난 것이 아닙니다)
요약
듀얼 GPU 환경에서 모델 추론 시 GPU 사용률이 낮게 나타나는 원인이 연산 능력이 아닌 메모리 대역폭 제한에 있음을 설명합니다. 토큰 생성 시마다 모델 가중치를 메모리에서 읽어와야 하는 병목 현상을 다룹니다.
핵심 포인트
- GPU 사용률이 낮은 이유는 연산 부족이 아닌 메모리 대역폭 제한 때문임
- 토큰 생성 시 모델 전체 가중치를 메모리에서 불러오는 과정이 필수적임
- GPU 대역폭(448GB/s)에 따른 이론적 토큰 생성 속도(25-30 tok/s)의 한계
저는 한동안 두 개의 5060 Ti를 사용하여 Qwen 3.6 27B (Q6, ~22GB)를 실행해 왔는데, 두 카드 모두 사용률이 ~50%를 넘지 않아서 제 설정에 무언가 잘못된 것이라고 계속 가정해 왔습니다. 어젯밤에 왜 그런지 실제로 알아내는 데 너무 많은 시간을 보냈고, 솔직히 말해서 꽤 흥미로운 탐구 과정(rabbit hole)이었습니다.
결과적으로 말하면, 단 하나의 토큰 (token)을 생성하는 것만으로도 GPU는 모델의 전체 가중치 (weights)를 메모리를 통해 불러와야 합니다. 연산 (compute)이 아니라 메모리 (memory)입니다. 즉, 22GB 모델은 단 하나의 토큰을 생성할 때마다 매번 22GB를 읽어야 한다는 뜻입니다. 그리고 제 카드들의 대역폭 (bandwidth)은 최대 약 448GB/s인데, 이는 어떤 설정을 건드리더라도 대략 25-30 tok/s로 제한된다는 것을 의미합니다. 솔직히 그 부분만으로도 많은 것이 설명되었습니다.
하지만 저를 실제로
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기