병목 현상은 사라지지 않는다: NVIDIA의 GPU 진화를 인류사로 읽다
요약
본 기사는 NVIDIA 신제품 발표에서 제시되는 성능 수치(예: 2,360배)의 함정을 분석합니다. 단순히 숫자의 크기만 비교하는 것이 아니라, 정밀도(FP16 vs NVFP4)와 계산 방식(dense vs sparse) 등 측정 조건이 달라진다는 점을 지적하며, 실제 성능 향상은 병목 현상을 완전히 제거하지 못하고 다른 곳으로 옮겨가는 경향이 있음을 주장합니다.
핵심 포인트
- 성능 수치 비교 시 정밀도 및 계산 전제 조건을 반드시 확인해야 합니다.
- 단순한 배율 비교는 오해를 불러일으킬 수 있으며, 조건의 불일치가 핵심입니다.
- 기술 발전은 병목 현상을 완전히 없애기보다 다른 영역으로 이동시키는 경향이 있습니다.
서론: '약 2,360배'와 '약 189배'의 차이는 무엇인가
NVIDIA의 신제품 발표를 보면, '이전 세대보다 ◯배 빠르다', 'AI 성능은 ◯PFLOPS' 같은 수치들이 연달아 나옵니다. 대단한 일이 일어나고 있다는 것은 알겠지만, 그 숫자들이 무엇을 측정하고 있는지는 솔직히 말해 '어렴풋이'만 알고 있었습니다.
그래서 NVIDIA의 공식 자료에 있는 숫자들만을 사용하여 2016년의 P100부터 2026년의 Rubin까지를 같은 자(物差し)로 다시 배열해 보았습니다. 먼저, 같은 10년 동안 두 가지 방식으로 나누어 계산한 결과입니다.
| 비교 방식 | 계산 | 배율 |
|---|---|---|
| 제목의 숫자를 나눔 (Rubin의 NVFP4・추론용 50 PFLOPS ÷ P100의 FP16 21.2 TFLOPS) | 50,000 ÷ 21.2 | 약 2,360배 |
| ... | ||
| 표 1: P100부터 Rubin까지의 배율. TFLOPS 값은 P100이 FP16, Rubin의 FP16은 dense입니다. 소비 전력만 P100→B200에서, Rubin의 값은 NVIDIA 공식 자료에서 확인할 수 없습니다. Rubin의 메모리 대역폭은 공식 자료 사이에서 값이 엇갈리고 있어 자세한 내용은 제5장의 표 2 뒤에 적었습니다. |

그림 1: 제목의 숫자를 비교하여, 추론용・sparse 전제를 순차적으로 제거해 나가면 약 2,360배가 약 189배가 됩니다.
같은 10년인데도 약 2,360배와 약 189배입니다. 차이인 약 12.5배는 정밀도를 낮춘 것(FP16→NVFP4로 약 8.8배)과 추론용・sparse 전제의 숫자를 사용한 것(추가로 약 1.4배)으로 설명할 수 있습니다. 둘 다 거짓은 아니지만, 같은 조건에서 비교된 숫자는 아닙니다.
먼저, 이 글에서 사용할 단어 세 가지만 확인하겠습니다.
- FLOPS: 1초 동안 수행할 수 있는 소수점 계산의 횟수입니다. T(테라)는 $10^{12}$승, P(페타)는 $10^{15}$승을 나타냅니다. -
정밀도 (FP16, FP8, FP4): 하나의 숫자를 몇 비트로 표현하는가입니다. 비트가 적을수록 한 번의 계산이 가벼워지고, 같은 칩에서도 많은 계산을 수행할 수 있습니다. - dense / sparse: 모든 숫자를 계산에 사용하는 것이 dense이고, 데이터 일부가 0임을 전제로 그 계산을 생략하는 것이 sparse(스파스)입니다. H100이나 Blackwell에서는 NVIDIA의 표기상, sparse 값은 dense 값의 정확히 2배가 됩니다.
이 글에서 하고 싶은 말은 단 하나입니다.
성능 향상이란 병목 현상을 없애는 것이 아니라, 다른 곳으로 계속 옮겨가는 것입니다. 병목 현상은 사라지지 않고, 형태를 바꾸어 돌아옵니다.
이를 인류사의 흐름(구석기 → 농경 → 교역 → 산업혁명 → 도시화)에 비유하면서 칩의 숫자로 확인해 보겠습니다. 인류사는 어디까지나 '비유'이며, 칩의 진화와 역사에 인과관계가 있다고 말하려는 것은 아닙니다.

그림 2: 이 글의 전체 지도입니다. 인류사의 비유(구석기 → 농경 → 교역 → 산업혁명 → 도시화)와, 각 시대에서 가장 막혔던 장소를 나열했습니다.
글을 다 읽었을 때, 발표회 숫자를 보고 다음 3가지를 확인할 수 있게 되는 것이 이 글의 목표입니다.
- 정밀도와 sparse 조건이 일치하는지
- 용량과 대역폭이 연산에 따라잡히고 있는지
- 전력과 랙 규모는 어떻게 되어 가는지
🪨 1. 구석기 시대(〜2005년): 도구는 하나의 용도에 고정되어 있었다
이 장의 포인트: 도구는 그림 그리는 전용이었고, 막혔던 것은 '그림 계산 자체의 속도'였습니다.
1999년 8월, NVIDIA는 GeForce 256을 발표하며 '세계 최초의 GPU'로 판매했습니다(출시는 같은 해 10월). 좌표 변환이나 라이팅(T&L) 계산을 CPU가 아닌 칩 측 하드웨어가 담당하게 된 세대입니다(NVIDIA 블로그). 2001년 2월의 GeForce 3에서는, 정점이나 픽셀 처리를 프로그램으로 재작성할 수 있는 셰이더로 다룰 수 있게 되었습니다.
여기까지의 GPU는 어디까지나 '화면에 그림을 내보내는' 전용품입니다. 비유하자면, 고기 자르기, 가죽 벗기기 등 특정 작업에 맞춰 갈아낸 석기였고, 속도 경쟁 역시 그림 그리는 속도에 국한되어 있었습니다.
다만, 돌이켜보면 씨앗은 뿌려져 있었습니다. 셰이더가 재작성된다는 것은, 렌더링 외의 계산에도 같은 도구를 사용할 여지가 열렸다는 의미이기도 합니다.
🌾 2. 농경과 잉여(2006~2011년): CUDA로 '남는 연산 능력'을 사용하게 되다
이 장의 핵심: CUDA를 통해 '남는 연산 능력'을 다른 작업으로 돌릴 수 있게 되었고, 병목 현상은 '사용처를 쓸 소프트웨어' 쪽으로 옮겨갔습니다.
2006년 11월, NVIDIA는 CUDA를 발표했습니다. GPU를 렌더링 외의 계산에도 사용하기 위한 메커니즘이며, 최초 대응 제품은 GeForce 8800입니다.
농경이 시작되자 식량의 잉여가 생겨났고, 이것이 분업으로 이어졌다고 설명됩니다(Wikipedia, World History Encyclopedia). 다만, 잉여가 분업을 낳았다는 논리에는 이견도 있어 정설이라기보다는 일반적인 설명입니다. GPU에서도 비슷한 일이 일어났습니다. 다수의 연산 장치를 나열한 칩에는 렌더링 외에 쓸 여지가 있었습니다. CUDA는 그 '남은 연산 능력'을 다른 작업으로 돌릴 수 있게 만든, 말하자면 경작 기술입니다.
이 시기에 작용한 병목 현상은 하드웨어가 아니라 소프트웨어였습니다. 계산력은 눈앞에 있는데, 그것을 사용할 프로그램을 쓸 수 있는 수단이 없는 상태에서, 쓸 수 있는 상태로 옮겨간 것입니다.
참고로, 이 시대의 칩들은 본 기사의 기준(FP16 연산 성능과 메모리 대역폭)으로 공식 자료를 통해 같은 조건으로 나열할 수는 없습니다. 따라서 이 장까지는 숫자를 제시하지 않습니다.
🚢 3. 교역과 운송(2012~2016년): '옮기는 힘'이 질문받기 시작하다
이 장의 핵심: 만드는 힘뿐만 아니라 '운반하는 힘'이 과제가 되었습니다. 기준은 FLOPs/byte이며, P100은 약 29입니다.
2012년에 발표된 AlexNet은 GPU로 학습한 심층 신경망의 대표적인 예시로 자주 언급됩니다. 논문에 따르면, GTX 580(메모리 3GB)을 2개 사용해 약 6,000만 개의 파라미터를 5~6일에 걸쳐 학습했습니다. 게다가 1개의 GPU로는 메모리가 부족하여 네트워크를 2개로 나누어 올렸다고 쓰여 있습니다. 메모리 용량의 벽은 이 시점에서 이미 나타나고 있었습니다.
2016년에 등장한 Tesla P100은 NVIDIA가 HBM2를 채택한 최초의 GPU 가속기 칩으로 소개된 제품입니다. HBM2는 GPU 바로 옆에 여러 층을 쌓아 올린 고대역폭 메모리입니다. GPU끼리 연결하는 NVLink도 포함되어, 최대 4 링크로 양방향 합계 160 GB/s가 되었습니다. 같은 해 4월에 발표된 DGX-1은 P100을 8개 장착하여 FP16으로 최대 170 TFLOPS를 자랑하며, NVIDIA는 이를 'x86 서버 250대 분'이라고 설명했습니다(이는 NVIDIA의 주장입니다).
교역이 활발해지면 물건을 만드는 힘만큼 운반하는 길이 중요해집니다. P100은 딱 그 단계였습니다. 여기서 본 기사에서 여러 번 사용할 지표를 하나 도입합니다.
FLOPs/byte = 연산 성능 ÷ 메모리 대역폭
'메모리에서 1바이트 가져오는 동안 몇 번 계산할 수 있는 힘이 있나'를 나타냅니다. 값이 클수록, 연산력에 비해 데이터 공급이 따라가지 못하는(계산기가 기다리기 쉬운) 상태에 가까워집니다. 실제 영향은 처리 내용에 따라 다르지만, 세대 간 비교에는 사용할 수 있습니다.
P100은 FP16으로 21.2 TFLOPS ÷ 0.732 TB/s = 약 29입니다. 이 숫자를 기억해 주세요.
그림 3: FLOPs/byte는 '연산 성능 ÷ 메모리 대역폭'입니다. 값이 클수록, 데이터 공급이 따라가지 못하여 연산기가 기다리기 쉽습니다.
🏭 4. 산업혁명(2017~2022년): 저정밀도라는 '보폭'으로 한 번에 나아가다
이 장의 핵심: Tensor Core와 저정밀화로 연산이 급격히 늘어났고 (FLOPs/byte 29 → 139 → 295), 벽은 '연산'에서 '데이터 공급'으로 옮겨갔습니다.
2017년의 V100에서는 행렬 계산에 특화된 회로인 Tensor Core가 들어왔습니다. FP16 연산 성능은 P100의 21.2에서 V100의 125 TFLOPS로 약 5.9배입니다. 한편, 메모리 대역폭은 0.732에서 0.9 TB/s로 약 1.2배에 그쳤습니다. FLOPs/byte는 29에서 139로 뛰어올랐습니다.
주의할 점은 P100의 FP16은 Tensor Core를 사용하지 않는 값입니다(CUDA 코어의 하프 정밀도). V100의 도약은 순수한 칩의 발전이라기보다는 '행렬 연산에 특화된 회로를 추가한' 설계 변경의 효과가 더 큽니다. V100의 데이터시트에서도 일반적인 연산 성능과는 별도로 Tensor 성능이 기재되어 있습니다.
그 후에도 A100(2020년)은 312 TFLOPS・2.039 TB/s・80GB로 FLOPs/byte는 153이었고, H100(2022년)은 989.5 TFLOPS・3.35 TB/s・80GB로 295까지 증가하며 계속 성장합니다. P100부터 H100까지의 6년 동안 FP16 연산은 약 47배, 메모리 대역폭은 약 4.6배, 용량은 5배입니다. 이를 2년 단위로 환산하면, 연산은 약 3.6배, 대역폭은 약 1.7배가 됩니다. 이는 약 20년 분량의 데이터를 분석한 논문(Gholami et al.)이 제시하는 피크 연산이 2년 만에 약 3.0배, DRAM 대역폭이 약 1.6배라는 경향과 비슷한 수치입니다. 이것을 '메모리 병목 현상(memory wall)'이라고 부릅니다.
여기서 효과를 발휘하는 것이 정밀도를 낮춘다는 방법입니다. 정밀도를 낮추면(FP16→FP8) 하나의 숫자를 표현하는 비트 수가 절반이 됩니다. 보폭을 절반으로 줄이면 같은 시간에 두 배의 걸음 수를 확보할 수 있다는 이미지로, 칩은 연산 횟수를 늘릴 수 있습니다. 게다가 숫자가 작아지기 때문에 메모리에서 전송해야 하는 데이터 양도 줄어듭니다. H100은 FP8을 지원하며, dense 값으로 1,979 TFLOPS(FP16의 2배)를 구현합니다.

그림 4: 정밀도를 낮추면 하나의 숫자에 사용되는 비트 수가 줄어들어 같은 칩에서도 피크 성능이 향상됩니다. B200에서는 FP16 dense부터 FP4 sparse까지 최대 8배의 차이가 있습니다.
하지만 이것은 '병목 현상의 해소'는 아닙니다. 정밀도를 낮출수록, 동일한 대역폭이라도 피크 값으로 본 FLOPs/byte는 올라가기 때문에, 병목 현상은 '연산 속도'에서 '데이터 공급' 쪽으로 모습이 바뀌어 남아 있습니다. 발표회에서
| 칩 | 연도 | FP16 연산(TFLOPS) | 메모리 대역폭(TB/s) | 용량(GB) | FLOPs/byte | 소비 전력 |
|---|---|---|---|---|---|---|
| P100 | 2016 | 21.2 | 0.732 | 16 | 29 | 300W |
| ... | ||||||
| 표 2: 세대별 수치(FP16・dense 기준). B200과 B300은 HGX 구성의 GPU 1개당 값(8GPU의 값 ÷ 8)이며, GB200/GB300 계열과는 수치가 다릅니다. Rubin은 NVIDIA의 공시값입니다. H100의 dense 값은 공식 페이지에 실린 sparse 표기(1,979 TFLOPS)의 절반이고, HGX B200의 공식표도 sparse 표기이므로 dense는 절반으로 했습니다. B200의 소비 전력 1,000W는 Lenovo 자료의 값이며, NVIDIA 공식 자료에서는 GPU 단일체의 값을 확인할 수 없습니다. |
한 가지 주의할 점이 있습니다. Rubin의 메모리 대역폭은 NVIDIA 개발자 블로그에서 '최대 22 TB/s'이고, DGX Rubin NVL8 페이지(8GPU로 176 TB/s)도 같은 값입니다. 반면, Vera Rubin NVL72 제품 페이지 사양표에서는 19.2 TB/s이고, HGX 페이지는 8GPU로 130 TB/s(1GPU당 약 16.3 TB/s)입니다. 현재 값이 무엇인지 적은 공식 자료를 찾을 수 없었습니다. 이 기사는 22 TB/s를 채택했습니다(2026년 10월 기준). 만약 19.2 TB/s라면, FP16의 FLOPs/byte는 182가 아니라 약 208이 되고, FP4(dense)는 1,591이 아니라 약 1,823이 됩니다. H100보다 낮아진 점도, B200보다 높아진 점도 변하지 않습니다.
하지만 병목 현상이 사라진 것은 아닙니다. 이유는 3가지가 있습니다.
① 저정밀도에서는 또다시 격차가 벌어진다. FP4(dense)로 FLOPs/byte를 계산하면, B200이 1,125이고 Rubin이 1,591입니다. 정밀도를 낮춰 연산을 늘리면, 같은 대역폭에서도 벽은 돌아옵니다. Blackwell에서 Rubin으로의 성장은 NVIDIA 비교표의 수치 간(50 PFLOPS ÷ 10 PFLOPS)으로 나누면 5배로 보입니다. 다만 50은 추론용・sparse 전제이고, 10은 dense 값입니다. FP4의 dense끼리(HGX B200의 9 PFLOPS와 Rubin NVL72의 35 PFLOPS)라면 약 3.9배, FP16이라면 약 1.8배입니다.
② 용량은 연산만큼 늘지 않았다. P100부터 Rubin까지, FP16 연산은 약 189배, 용량은 18배(16GB→288GB)로, 약 10배의 차이가 있습니다. AlexNet이 '메모리가 부족하여 2개로 나눴다'는 문제는 규모를 바꿔서도 지금도 계속되고 있습니다.
③ 전력이 늘고 있다. P100의 300W에서 B200의 1,000W로, 약 3.3배입니다. Rubin의 소비 전력은 NVIDIA 공식 자료에서는 찾을 수 없었습니다.
더 나아가, 칩 단일체의 수치뿐만 아니라, GB200 NVL72처럼 72개의 GPU를 NVLink 스위치(130 TB/s)로 하나의 랙에 모으는 설계가 전면에 나타났습니다. 인류사로 비유하자면, 사람이 한곳에 모여 도시가 되고 도로나 수도나 전력 같은 인프라가 생활의 제약이 되어가는 단계와 비슷합니다. NVIDIA가 AI 팩토리를 위한 800 VDC 공급 아키텍처를 공식 블로그에서 설명한 것도, 병목 현상이 칩 외부로 이동하고 있다는 한 예시라고 저는 생각합니다. 다만, 도시 비유도, 이 해석도 저의 해석이며 데이터로 증명된 것은 아닙니다.
요약: 발표회 수치를 읽기 위한 3가지 체크
여기까지를 한마디로 말하면, NVIDIA의 칩은 병목 현상을 없애온 것이 아닙니다. 연산 → 메모리 대역폭 → 용량 → 전력과 랙으로, 다른 장소로 계속 옮겨왔을 뿐입니다. 다음에 발표회에서 '몇 배'라는 수치를 본다면, 이 3가지를 확인해 보세요.
- 정확도와 희소성: 정확도는 FP16, FP8, FP4 중 어느 것을 사용하며, 조건은 dense인지 sparse인지. 같은 B200이라 하더라도, FP16의 dense(2,250 TFLOPS)와 FP4의 sparse(18,000 TFLOPS)는 8배 차이가 납니다. -
- 용량과 대역폭: 연산이 늘어난 만큼 메모리 대역폭과 용량도 증가했는지. FLOPs/byte가 이전 세대보다 높아졌는지, 낮아졌는지. -
- 전력과 랙 규모: 칩 하나의 소비 전력과, 72개를 채운 전체 랙의 구성. 칩 단독 수치와 시스템 전체 수치를 혼동하고 있지는 않은지.

그림 6: 발표회 자료를 보고 확인할 3가지 포인트를 수치 예시와 함께 한 장으로 정리했습니다.
마지막으로, 이 기사의 한계점입니다. 수치는 NVIDIA의 공식 자료에 기반하고 있지만, Rubin의 값은 제조사의 공칭값이며 독립적인 벤치마크는 아직 확인되지 않았습니다(2026년 10월 기준). HGX와 GB200/GB300 계열처럼 구성이 다르면 수치도 달라집니다. 또한, 인류사와의 비유는 가독성을 위해 사용한 유추일 뿐, 인과관계를 주장하는 것은 아닙니다.
"병목 현상은 사라지지 않고, 형태를 바꿔 돌아온다". 다음 발표회에서는 수치 뒤편에서 다음 벽이 어디로 이동했는지 찾아보면 훨씬 흥미롭게 보일 것입니다.
참고 링크
NVIDIA의 1차 자료
- Tesla P100 데이터시트
- Inside Pascal(P100 해설)
- Tesla V100 데이터시트
- A100
- H100
- HGX(B200・B300・Rubin 사양표)
- DGX B200(메모리 용량・대역폭 사양)
- Blackwell 아키텍처
- Inside NVIDIA Blackwell Ultra
- Inside NVIDIA Rubin GPU Architecture
- GB200 NVL72
- 800 VDC 전원 공급 아키텍처(NVIDIA 블로그)
- DGX-1 발표(보도 자료 인용)
논문・벤더 자료
- AlexNet 논문(NIPS 2012)
- Gholami et al., AI and Memory Wall(arXiv)
- Lenovo Press:ThinkSystem NVIDIA B200 180GB 1000W GPU
보도・백과사전 (역사 부분만)
Discussion

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기