GPU 전력 효율 향상을 위한 팁과 요령
요약
GPU의 주파수와 전력 제한 설정을 조절하여 전력 효율을 극대화하는 방법을 제안합니다. 성능을 소폭 희생하는 대신 토큰당 에너지 소비량을 크게 줄일 수 있는 실질적인 nvidia-smi 명령어 활용 팁을 공유합니다.
핵심 포인트
- 전력 제한 설정을 통해 성능 대비 에너지 효율(tokens/joule)을 25% 향상 가능
- nvidia-smi 명령어를 활용한 전력 및 클럭 조절 방법 제시
- 과도한 클럭 상승보다 적절한 전력 제한이 효율성 측면에서 유리함
- 레이어 분할 서빙 시 전력 제한은 발열 관리 측면에서 유용함
Darwin-36B (Qwen 3.6 35B-A3B 계열)를 사용하여 P100의 주파수 범위 전반에 걸쳐 간단한 테스트 스윕(test sweep)을 수행했습니다. 포괄적인 테스트는 아닙니다. 여러분의 전력 효율(power efficiency) 팁을 자유롭게 공유해 주세요. 단순히 원시 TPS(tokens per second)뿐만 아니라 효율성을 개선하는 방법을 탐구하면서 더 큰 스레드를 만들어 볼 수도 있을 것 같습니다.
직접 시도해 보세요:
sudo nvidia-smi -pm 1 -ac 715,1063 = 전력의 67% 수준에서 속도의 84%를 유지 (= 토큰/줄(tokens/joule) 기준 +25%). 재부팅 시 초기화되므로 시작 스크립트(startup script)에 추가하세요. 여러분의 결과를 보고해 주세요!
또한: 150W로 제한하는 것(-pl 150)은 이 워크로드에서 0.3%의 손실을 가져왔습니다. 레이어 분할 서빙(layer-split serving) 중에는 제한(cap)이 거의 걸리지 않으므로, 이는 무료로 얻는 열 보험(thermal insurance)과 같습니다.
내가 지금 무슨 말을 하고 있는 거냐고요?:
카드의 속도를 약간 늦추고 성능을 조금 희생하면, 불균형할 정도로 많은 양의 에너지를 절약할 수 있습니다. 클래식한 오버클러킹(overclocking)을 정반대로 뒤집은 셈이죠.
마지막 265 MHz를 얻기 위해 53 와트(방 몇 개를 밝힐 수 있는 전력)가 소모되는데, 정작 얻는 속도는 16%뿐입니다. 그것이 바로 여러분이 거부하고 있는 거래입니다.
submitted by /u/apollo_mg to r/LocalLLaMA
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기