연구원들, 하이퍼스케일러의 AI 전력 부족 문제에 가장 쉬운 해결책은 소프트웨어라고 말하다
요약
데이터 센터의 폭증하는 AI 전력 수요에 대응하여, 하드웨어 개선보다 소프트웨어 및 알고리즘 최적화가 더 효과적인 해결책으로 주목받고 있습니다. 연구원들은 모델 추론 시 FP8 같은 낮은 정밀도를 사용하거나, 학습 과정에서 작업 부하를 조절하는 등의 방식으로 에너지 효율을 높일 수 있다고 제안합니다.
핵심 포인트
- AI 전력 수요 폭증에 하드웨어보다 소프트웨어 최적화가 중요함.
- FP8 추론은 bfloat16 대비 에너지를 3분의 1 적게 소비함.
- Perseus optimiser는 학습 부하 조절로 에너지 절감 효과를 입증함.
- Nvidia도 전력 프로파일링을 통해 성능 저하 없이 에너지 효율 개선에 집중하고 있음.
데이터 센터의 에너지 수요는 끊임없이 증가하고 있습니다. 국제에너지기구(International Energy Agency)는 2030년까지 AI의 수요를 충족하기 위해 약 945TWh의 전기가 사용될 것으로 예상하며, 이는 오늘날 일본이 사용하는 전력량과 맞먹습니다. 에너지 부족은 피할 수 없는 문제이며, 업계의 답변은 대체로 물리적인 부분에 초점을 맞춰왔습니다: 더 효율적인 GPU를 구축하고 이미 빠듯한 전력망에서 더 많은 전력을 확보하는 것입니다. 하지만 하드웨어에 대한 이러한 근시안적 집중이 실제로 가치가 있을까요? 대신, 그 기계들 위에서 실행되는 작업 대부분을 줄여서 전력을 절약할 수는 없을까요?
Uptime Institute의 2025년 설문조사에 따르면 평균 전력 사용 효율성(PUE)은 6년간 거의 변하지 않았습니다. PUE는 냉각 및 전원 시스템이 낭비가 심한지 여부를 보여줄 수 있지만, 서버에서 실행되는 소프트웨어가 유용한 작업을 수행하는지는 고려하지 않습니다. 그리고 서버가 현대 데이터 센터의 전기 수요 중 약 60%를 차지하고, 냉각은 효율적인 하이퍼스케일 사이트에서는 약 7%에서부터 비효율적인 엔터프라이즈 시설에서는 30% 이상까지 범위가 넓기 때문에, 방정식의 소프트웨어 측면에서 더 많은 효율성을 짜내는 데 집중하는 것이 합리적으로 보입니다.
미시간 대학교 컴퓨터 과학 및 공학 박사 과정 학생이자 ML.Energy 이니셔티브 연구원인 Jae-Won Chung은 _Tom’s Hardware Premium_과의 인터뷰에서 “핵심 질문으로 보이는 ‘소프트웨어 또는 알고리즘이 전력과 에너지에 의미 있게 도움을 줄 수 있는가?’에 대한 답은 예, 100%입니다”라고 말했습니다.
Chung은 컴퓨팅 시스템을 하드웨어를 기반으로 하고, 그 위에 시스템 소프트웨어, 알고리즘, 애플리케이션이 쌓인 스택(stack)으로 봐야 한다고 제안한다. 이 방정식에서 가장 다루기 어려운 부분은 하드웨어 측면이다. 칩은 느리고 교체 비용이 많이 들기 때문이다. 하지만 나머지 세 계층은 변경하기가 더 쉽고, 여기서 얻는 효율성 증가는 복합적으로 작용할 수 있다.
ML.Energy가 테스트한 Alibaba Qwen 3 235B A22B Thinking 모델에 따르면, 문제 해결 작업에서 약간 낮은 정밀도의 형식인 FP8로 추론(inference)을 실행하는 것이 bfloat16 버전보다 에너지를 3분의 1 적게 소비했다. Chung이 개발한 Perseus training optimiser는 대규모 모델 학습 작업 중 작업량이 적은 부분을 식별하여, 그 부분의 속도를 늦춰서 더 바쁜 부분과 동시에 완료되도록 한다. 이 시스템은 처리량(throughput)을 줄이거나 하드웨어를 변경하지 않고도 최대 30%까지 학습 에너지를 절감했다.
이는 단순히 주변부에서 손대는 사소한 조정이 아니다. 일부 대형 GPU 기업들이 유사한 작업을 수행하고 있다. Nvidia의 Blackwell power profiles는 GPU 컴퓨팅 및 메모리 주파수, 전력 제한(power limits), NVLink 상태, 캐시 설정 등 모든 것을 워크로드에 맞게 미세 조정한다. Nvidia는 이를 통해 전체 성능의 97% 이상을 유지하면서 최대 15%까지 에너지를 절약할 수 있다고 믿으며, 이는 전력 제약이 있는 시설에서 더 많은 GPU를 구동하고 처리량을 최대 13%까지 높일 수 있게 한다.
‘가장 시끄러운 랙’
SHI의 데이터 센터 인프라 비즈니스 개발 매니저인 Chetan Visrolia는 _Tom’s Hardware Premium_과의 인터뷰에서 자신이 마주치는 가장 명백한 낭비는 종종 구형 코드를 지원하는 레거시 장비라고 말했다. 그는
클라우드 인스턴스는 더 스마트한 크기로 만들 수 있으며, 반복적으로 사용되는 AI 프롬프트는 즉석에서 재계산하는 대신 캐시에 저장할 수 있습니다. 또한 작은 모델이 일상적인 요청을 처리하고 큰 모델은 더 어려운 작업을 위해 아껴두는 방식으로 효율성을 높일 수도 있습니다. 동시에, 개선된 배치(batching)와 컴파일러를 통해 가속기 활용률을 높일 수 있으며, 프롬프트를 압축하고 출력에 제한을 두는 것도 처리되는 토큰 수를 줄이는 데 도움이 됩니다.
소프트웨어는 전기가 언제, 어디서 사용될지까지 바꿀 수 있습니다. Google의 글로벌 데이터센터 군집에서 워크로드 이동(workload shifting)을 연구한 ETH Zurich 자동 제어 실험실의 박사 과정 학생인 Sophie Hall은 _Tom’s Hardware Premium_과의 인터뷰에서 전기 소비 자체가 반드시 주요 문제는 아니라고 주장합니다.
그녀는 “더 정확히 말하면, 언제 사용하고, 어디서 사용하며, 그리드와 어떻게 상호작용하는가?”라고 말했습니다. 배치 작업이 시간 민감도가 높지 않다면, 지역 수요가 떨어질 때까지 지연시키거나 여유 용량과 저탄소 전기가 있는 지역으로 라우팅할 수 있습니다. Hall의 연구는 성능 보장을 유지하면서 그리드 신호에 대응하기 위해 일일 선행 계획(day-ahead planning) 및 실시간 스케줄링을 사용합니다.
Hall은 하이퍼스케일러들이 실제로 필요했던 것보다 훨씬 더 많은 용량을 구축했고 그리드가 병목 현상이 아니었을 때는 그러한 조치가 덜 필요했다고 말했습니다. 그러나 AI에 대한 막대한 수요가 방정식을 바꿨습니다.
하지만 한계도 있습니다. 개별 국가의 데이터 주권 규칙은 워크로드가 국경을 넘는 것을 막을 수 있으며, 대규모 데이터를 네트워크를 통해 이동시키는 것은 문제가 생길 경우 추론(inference) 제공업체들이 꺼리는 일입니다. Hall은 “데이터가 말 그대로 물리적, 지리적으로 다른 위치로 이동해야 합니다. 그것은 그렇게 쉽지 않습니다.”라고 말했습니다.
AI가 구동하는 데이터 센터 수요의 규모는 소프트웨어가 만능 해결책(silver bullet)이거나 더 나은 칩 및 새로운 전력 인프라를 대체할 수 있다는 것을 의미하지 않습니다. 하지만 이는 점점 비싸지는 자산에서 마지막 한 방울까지 짜낼 수 있는 제어 계층(control layer) 역할을 할 뿐만 아니라, 용량이 더 많은 곳으로 수요를 전환하는 데도 도움을 줄 수 있습니다.
제본스의 역설(Jevons’ paradox) 또한 작용하고 있으며, 시스템을 더 잘 작동시키는 방안을 생각할 때 고려해야 합니다. 효율성이 시설의 전력 사용량을 줄이지 못한다면, 절약된 와트(watt) 하나하나가 더 많은 토큰(token)을 생성하는 데 사용될 수 있기 때문입니다. 청(Chung)은 “전력은 AI 데이터 센터의 핵심 병목 지점(core bottleneck)입니다. 우리는 소비하는 모든 와트를 최대한 활용하고 싶습니다.”라고 말했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Tom's Hardware의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기