AI를 실행할 때 노트북이 뜨거워지는 이유: CPU와 GPU에 대한 제1원리적 고찰
요약
AI 모델 실행 시 노트북의 발열과 성능 저하가 발생하는 이유를 CPU와 GPU의 물리적 설계 차이를 통해 분석합니다. CPU의 낮은 지연 시간 중심 설계와 GPU의 높은 처리량 중심 설계의 차이를 제1원리 관점에서 설명합니다.
핵심 포인트
- CPU는 낮은 지연 시간을 위해 높은 전압과 주파수를 사용하여 발열이 심함
- CPU 공간의 대부분은 계산기(ALU)가 아닌 캐시와 분기 예측기에 할당됨
- GPU는 예측 로직을 줄이고 수만 개의 계산기를 배치하여 처리량에 최적화됨
- AI 작업은 복잡한 결정보다 대규모 행렬 연산이 핵심이기에 GPU가 유리함
만약 여러분이 일반적인 노트북에서 최신 AI 모델을 실행해 본 적이 있다면, 그 정확한 소리를 알고 있을 것입니다. 팬은 최대 속도로 회전하고, 본체는 달걀을 프라이할 수 있을 정도로 뜨거워지며, 출력 결과는 화면 위를 한 단어씩 아주 느릿느릿 기어갑니다.
여러분은 아마 이렇게 궁금해할지도 모릅니다. "내 노트북은 아주 최신형이고 믿을 수 없을 정도로 빠른데, 왜 이렇게 힘겨워하는 거지?"
최근에 저는 정확히 왜 이런 일이 발생하는지 이해하기 위해 나섰습니다. 일반적인 고수준의 비유("CPU는 빠른 자동차이고, GPU는 버스다")를 받아들이는 대신, 저는 절대적인 제1원리 (First Principles)를 살펴보고 싶었습니다. 저는 실리콘의 물리학을 이해하고 싶었습니다.
제가 배운 것은 계산 (Computation)을 바라보는 저의 관점을 완전히 바꾸어 놓았습니다. 여러분의 노트북은 고장 난 것이 아닙니다. 그것은 단지 화물 열차가 해야 할 일을 강요받고 있는 페라리일 뿐입니다.
다음은 왜 CPU가 AI 작업에서 막히는지, 그리고 왜 GPU가 AI 혁명의 논란의 여지 없는 엔진이 되었는지에 대한 기계적 분석입니다.
1. 물리학의 함정: 왜 그냥 더 큰 CPU를 만들 수 없는가?
AI가 수천 개의 동시 계산을 필요로 한다는 것을 깨닫게 되면, 논리적인 첫 번째 질문은 이것입니다: 왜 단일 칩에 10,000개의 CPU 코어를 넣지 않는가?
정답은 물리학입니다. 구체적으로는 열, 속도, 그리고 전기적 압력 사이의 관계입니다.
$P = N \cdot C \cdot V^2 \cdot f$
표준 CPU는 엄청나게 빠른 지연 시간 (Latency)을 위해 설계되었습니다. 즉, 단일 작업을 즉각적으로 끝내기를 원합니다. 이를 위해 칩 내부의 "컨베이어 벨트"는 믿을 수 없는 속도 (주파수 (Frequency), 보통 약 4.0 ~ 5.0 GHz)로 작동합니다. 전자를 그토록 빠르게 밀어내려면 높은 전기적 압력 (전압 (Voltage))이 필요합니다.
전력은 주파수와는 선형적으로 비례하지만 전압과는 지수적으로 비례하기 때문에, 10,000개의 CPU 코어를 5.0 GHz로 실행하면 수천 와트의 열이 발생할 것입니다. 칩은 말 그대로 메인보드를 녹여버릴 것입니다.
칩을 녹이지 않고 수천 개의 코어를 칩에 넣으려면 속도와 전압을 급격히 낮추어야 합니다. 하지만 그렇게 하면 더 이상 CPU 설계를 사용할 수 없습니다.
2. 실리콘 부동산: 두뇌 vs 근력 (Brains vs. Brawn)
단일 CPU 코어의 설계도(blueprint)를 살펴보면 놀라운 사실을 발견하게 됩니다. 실제로 수학 연산을 수행하는 부분(ALU)은 아주 작다는 점입니다.
CPU의 물리적 공간 대부분은 거대한 메모리 데스크(Caches, 캐시)와 분기 예측기(Branch Predictors)라고 불리는 거대한 신경망 형태의 회로에 할당되어 있습니다. 왜 그럴까요? 운영체제(Operating System)를 실행하거나 웹 브라우저를 사용하는 것과 같은 일반적인 컴퓨터 작업들은 매우 예측 불가능하기 때문입니다. 이러한 작업들은 if/else 결정문으로 가득 차 있습니다. CPU는 사용자가 다음에 무엇을 클릭할지 예측하여 대기 시간을 없애기 위해 공간의 80%를 사용합니다. CPU는 믿을 수 없을 정도로 똑똑하지만, 계산기(calculators)는 매우 적습니다.
반면 GPU는 근력을 위한 공간을 확보하기 위해 똑똑함을 버렸습니다.
하드웨어 엔지니어들은 거대한 캐시와 예측 로직을 제거했습니다. 그 대신, 수천 수만 개의 "멍청한" 계산기들을 타일처럼 깔았습니다. GPU는 당신이 다음에 무엇을 클릭할지에 관심이 없습니다. GPU는 거대한 처리량(Throughput)에 최적화되어 있습니다.
1. 대결: 미로 vs 행렬 (The Maze vs. The Matrix)
이것이 왜 중요한지 알아보기 위해, 두 칩에 데이터를 입력한다고 상상해 봅시다.
운영체제 작업 (미로):
예측 불가능한 굴곡과 회전이 가득한 작업(예: 만약 사용자가 마우스를 클릭하면 창을 열고, 그렇지 않으면 대기하라)을 상상해 보세요.
CPU: 미로를 날아다닙니다. 거대한 두뇌가 회전 구간을 완벽하게 예측합니다.
GPU: 처참합니다. GPU는 작업자들을 32명 단위의 팀으로 그룹화합니다(SIMT라고 불리는 개념). 32명의 노를 젓는 사람이 탄 배를 상상해 보세요. 만약 코드에서 "절반은 왼쪽으로, 절반은 오른쪽으로 저으라"고 명령한다면, 배는 멈춰버립니다. 그들은 교대로 움직여야 합니다. 이를 워프 발산(Warp Divergence)이라고 하며, 이는 GPU의 효율성을 완전히 무너뜨립니다.
AI 작업 (행렬):
AI 모델을 학습시키거나 실행하는 것은 본질적으로 거대한 숫자 격자(matrices, 행렬)들을 서로 곱하는 과정입니다. 이는 수백만 개의 독립적인 수학 문제를 필요로 합니다. 여기에는 예측 불가능한 if/else 분기가 존재하지 않습니다.
CPU: 거대한 교통 체증입니다. 단 하나뿐인 초고속 계산기가 수백만 개의 수학 문제로 범람합니다. CPU는 이 문제들을 순차적으로 처리하려다 숨이 막힙니다.
GPU: 격자망에 불이 켜집니다. 수학 연산이 동일하고 예측 가능하기 때문에, GPU는 수천 개의 계산기에 단일 명령(Single Instruction)을 동시에 방송합니다. 거대한 행렬이 밀리초(ms) 단위로 증발합니다.
결론 (Conclusion)
이 심층 분석을 통해 이러한 개념들을 시각적으로 증명하는 대화형 웹 시뮬레이터를 제작할 영감을 얻었습니다. 사용자는 물리 방정식을 조정하여 CPU를 "녹여" 보거나, 다이 샷(Die shot)을 확인하고, 서로 다른 데이터 워크로드(Workload)에 대해 두 칩을 경주 시켜 볼 수 있습니다.
연산의 베어 메탈(Bare metal) 현실을 이해하면 AI에서 마법 같은 요소가 사라집니다. 그것은 전혀 마법이 아닙니다. 그저 수천 가지의 단순한 일을 정확히 동시에 수행하도록 설계된 칩에 완벽하게 부합하는, 당혹스러울 정도로 병렬적인 (Embarrassingly parallel) 수학 문제일 뿐입니다.
초보자를 위한 용어 사전 (The Beginner’s Glossary)
하드웨어에 대해 더 깊이 알고 싶다면, 업계에서 실제로 사용되는 용어들을 쉬운 영어로 번역한 아래 목록을 참고하세요:
🧮 ALU (Arithmetic Logic Unit, 산술 논리 장치): 실제 계산기입니다. 수학 연산을 수행하는 칩의 아주 작은 부분입니다.
🖥️ 캐시 (Cache): 작업자 바로 옆에 있는 초고속 책상입니다. 데이터를 가져오기 위해 도서관(메인 RAM)까지 걸어가는 것보다 훨씬 빠릅니다.
⏱️ 지연 시간 (Latency): 지연입니다. 단일 작업이 시작부터 끝까지 완료되는 데 걸리는 속도입니다. CPU는 낮은 지연 시간의 달인입니다.
📦 처리량 (Throughput): 양입니다. 1분 동안 완료되는 총 작업량입니다. GPU는 높은 처리량의 달인입니다.
⚡ 전압 (Voltage): 전기적 압력입니다. 더 강하게 밀어붙이면 칩은 더 빨라지지만, 기하급수적으로 더 많은 열을 발생시킵니다.
⚙️ 주파수 (Frequency, GHz): 클록 속도(Clock Speed)입니다. 칩에 작업을 공급하는 컨베이어 벨트의 속도와 같습니다.
🚣 SIMT (Single Instruction, Multiple Threads, 단일 명령 다중 스레드): 32명의 작업자가 노를 정확히 동시에 젓는 조정 팀과 같습니다. GPU 병렬성의 비밀입니다.
🚧 워프 분기 (Warp Divergence): if/else 명령이 조정 팀을 갈라놓을 때 발생합니다. 한쪽이 방향을 트는 동안 나머지 절반은 노 젓기를 멈춰야 하며, 이로 인해 모든 작업이 느려집니다.
읽어주셔서 대단히 감사합니다. 무언가 배우는 시간이 되었기를 바랍니다. 앞으로...
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기