엔비디아 진짜 해자는 GPU가 아니다 | CUDA·NVLink·Mellanox가 만든 AI 시스템
요약
본 영상은 AI 성능의 핵심 동력이 단순히 GPU 자체의 계산 능력(Compute Power)만이 아님을 주장합니다. 엔비디아의 진정한 해자는 GPU를 구동하고 데이터 센터 전체 시스템으로 확장하는 CUDA, NVLink, Mellanox 같은 소프트웨어 및 인프라 생태계에 있다고 분석합니다. 즉, 하드웨어와 이를 연결하는 시스템이 AI 성능을 결정한다는 것입니다.
핵심 포인트
- AI 성능은 GPU의 계산 능력뿐 아니라 데이터를 제때 공급받는 시스템 전체가 중요함.
- GPU는 본래 그래픽 처리를 위해 발전했으나, CUDA를 통해 범용 병렬 컴퓨팅 플랫폼으로 확장됨.
- 엔비디아는 GPU 외에도 네트워크 카드(Mellanox)와 서버 인프라까지 설계하며 생태계를 구축함.
Video: 엔비디아 진짜 해자는 GPU가 아니다 | CUDA·NVLink·Mellanox가 만든 AI 시스템
Channel: 안될공학 - IT 테크 신기술
Duration: 17m 58s
Source: subtitle (auto, ko)
Transcript:
여러분 안녕하세요. 패치입니다. 패치의 반도체 침문학 3편으로 찾아왔습니다. 지난 시간에는 저희가 AI칩 바로 옆에 붙는 HBM이 왜 이렇게 뜨거운 병목이 되는지 살펴보았죠. GPU가 아무리 빠르게 계산을 해도 필요한 데이터를 제대 받지 못하면 수많은 연상기가 멈춰서 기다리기 때문에 AI의 성능은 GPU 안에 계산 능력만으로는 결정되지 않는다는 그런 이야기였습니다. 그런데 Nv디아를 조금 더 넓게 보면 이상한 점이 하나 보이는데요. 원래 게임용 그래픽 카드를 만들던 회사가 지금은 CPU랑 네트워크 카드 스위치를 만들고 서버랑 렉 전체까지 설계를 합니다. 19년에는 고성능 네트워크 회사인 멜라녹스를 약 69억 달러 인수하겠다고 발표를 했고이 거래는 2020년에 완료됐어요. 그래픽카드 회사가 대체 왜 네트워크 회사까지 필요했던 걸까요? 오늘 질문은 바로 이것입니다. 엔비디아의 진짜 해자는 GPU일까요? 아니면 GPU들이 실제로 일하게 만드는 시스템일까요?이 이 질문에 대답을 하려면 GPU 한장에서 출발을 해서 서버랑 렉, 데이터 센터까지 범위를 넓혀 가야 합니다.
그 과정에서 계속 확인해야 할 것은 하나이고요. GPU는 지금 무엇을 기다리고 있는가? 먼저 GPU가 왜 그래픽 분야에서 발전을 했는지 짧게 다시 짚어 볼게요. 우리가 모니터에서 하나의 화면을 본다는 건 디스플레이를 이루는 수많은 점에 어떤 색과 밝기를 표시할지 계속 계산하고 있다는 뜻입니다. 풀 HD 화면만 해도 한 장에는 200만 개가 넘는 픽셀이 있고요. 게임에서는 캐릭터가 움직이거나 카메라 조명이 바뀔 때마다이 픽셀들의 색을 다시 계산해야 하죠. 화면을 1초에 60번을 보여 준다면 60장의 화면을 새로 만들어야 되고요. 120프레임이라면이 과정을 1초에 120번을 반복을 해야 돼요. 픽셀 하나의 계산은 아주 복잡하지 않을 수 있지만 비슷한 계산을 엄청나게 많은 점에 적용을 해야 합니다. 그래서 그래픽 칩은 복잡한 일 하나를 빠르게 끝내기보다는 많은 연상기가 비슷한 계산을 나눠서 맞는 방향으로 발전을 했습니다. GPU가 순서가 복잡하고 예외가 많은 일을 처리하는 소수 정애라면 GPU는 같은 종류의 일을 대량으로 처리하는 그런 계산 공장에 가까운 거죠.
AI 신경망도 수많은 숫자의 비슷한 곱셈과 덧셈을 반복을 하는데요. 그래픽의 픽셀 계산이랑 AAI의 학습이 같은 작업은 아니지만 많은 데이터를 비슷한 방식으로 동시에 처리할수록 유리하다는 점은 닮아 있었죠. 그렇다면 GPU가 병렬 연산을 잘한다는 사실만 알게 되면 곧바로 AI에 사용할 수 있었을까요? 그렇지는 않았습니다. GPU 안에 수많은 연상기가 있다는 것이라 연구자가 그 연상기들에게 자신이 원하는 일을 시킬 수 있다는 것 또 다른 문제였거든요. 초기의 GPU는 화면을 그리는 장치였습니다. 과학 계산을 하려는 연구자도 숫자를 세기나 위치 정보처럼 바꾼 뒤에 그래픽 명령으로 처리를 하고 그 결과를 다시 꺼내야 했죠. 계산기는 가득했지만 그래픽이 아닌 계산을 편하게 전달을 할 작업 지시 체계가 없었던 거예요. 자, 여기서 등장한 것이 바로 쿠다입니다. 스탠드 대학교에서 GPU 범용 계산을 연구를 하던 이안버의 팀은 브룩이라는 프로그래밍 모델을 개발을 했는데요. 엔비디아는 이안을 2004년에 영입을 했고요.이 연구의 흐름은 개발자가 과학 계산을 그래픽 작업처럼 위장을 하지 않고도 C와 C뿔뿔에 가까운 방식으로 GPU에 전달을 할 수 있게 한 쿠다로 이어집니다.
쿠다가 GPU를 병렬 프로세서로 만든 건 아니에요. GPU는 이미 수많은 픽셀을 계산을 하기 위해서 병렬 구조로 발전을 하고 있었고 쿠다는 다만 그 능력을 그래픽 밖에서도 꺼냈을 수 있도록 만든 플랫폼입니다. 그 이후에 엔비디아는 쿠다 프로그램이 더 잘 실행될 수 있도록 GPU의 명령 구조랑 메모리, 연산기랑 개발 도구를 함께 발전시키기 시작을 했는데요. 그러니까 결국 쿠다가 GPU의 활용 범위를 넓혔고 넓어진 활용 범위가 다시 GPU의 설계를 바꾼 거죠. 쿠다랑 GPU의 구조 텐서 코어 CPU랑 GPU의 차이가 지금 조금 낯설게 느껴지신다면 패치에 측문하기 1편 GPU는 왜 AI 시대에 왕이 됐을까를 다시 참고해 주세요. 이번 편에서는 그 기반 위에다가 GPU 한 장이 여러 장의 시스템으로 확장이 되는 그 과정에 집중을 하도록 하겠습니다. 쿠다는 단순한 프로그래밍 언어 하나가 아닙니다. 개발자의 코드를 GPU가 실행할 수 있게 바꾸는 컴파일러랑 오류를 찾는 디버거 성능 분석 도구가 있고요. 그 위에는 자주 사용하는 계산을 미리 최적화한 라이브러리가 올라가게 됩니다.
AI에서는이 라이브러리가 특히 중요했는데요. 같은 행렬 곱도 데이터를 어떻게 나누고 어느 순서로 메모리를 꺼내고 연산기에 얼마나 빈틈 없이 공급하느냐에 따라서 속도가 크게 달라지기 때문이죠. 그래서 엔비디아는 신경망 연산을 최적화한 쿠 같은 라이브러리를 만들었습니다. 이후에 파이토치랑 텐서플러 같은 프레임워크가이 라이브러리를 사용을 하면서 개발자는 쿠다 코드를 직접 쓰지 않고도 엔비디아 GPU를 활용할 수 있게 됐죠. 개발자가 파이토치에서 모델을 만들면 그 아래에서 프레임워크랑 라이브러리 쿠다랑 GPU가 다 함께 움직입니다. 쿠다가 개발자의 화면에서는 잘 보이지 않게 됐지만 AI 개발 환경 아래에는 더 깊이 들어간 거죠. 2012년 알렉스넷은 두 장의 G포스 GTX 580으로 학습이 돼서 이미지넷에서 큰 성능 차이를 만들었습니다. 엔비디아가 이때부터 벌써 지금의 생성형 AI 시대를 모두 내다봤다고 하면 조금 과장일 수도 있겠지만 AI 연구가 폭발하기 시작했을 때 이미 병렬 연산 하드웨어랑 연구자가 그 하드웨어를 사용할 쿠다를 함께 갖추고 있었습니다.
그래서 새로운 AI 연구가 등장을 했을 때 GPU는 단순히 계산을 잘하는 칩이 아니라 이미 연구자가 사용할 수 있는 계산 플랫폼이었죠. 여기까지는 지난 1편에서도 다룬 이야기인데 그다음부터 M비DI에는 완전히 다른 문제가 생기기 시작을 합니다. 모델이 GPU 한 장을 넘어섰기 때문이에요. AI 모델을 학습을 할 때 GPU 메모리에 들어가는 건 모델 파일만이 아닙니다. 입력 데이터랑 계산 도중에 만들어지는 중간 결과가 저장이 되고요. 모델의 숫자를 어느 방향으로 고칠지 계산을 하기 위한 값들도 필요하죠. 그래서 학습에 필요한 메모리는 모델 파일의 크기보다도 훨씬 더 커질 수 있습니다. GPU가 왜 이렇게 많은 메모리를 필요로 하고 데이터를 기다리는 시간이 왜 성능을 제한하는지는 패치의 반도체 측문학 2편. HBM은 왜 AI보다 더 뜨거운 병목이 됐을까 해서 자세히 다뤘으니까 한번 리뷰를 하고 오세요. 자, 그럼 여기에서는 메모리 문제를 넘어서서 모델이 여러 GPU로 확장이 됐을 때 생기는 통신 문제에 집중을 좀 해 볼게요.
GPU 한 장에 들어가지 않으면 모델을 여러 GPU에 나누거나 같은 모델을 여러 GPU에 복사를 하고 학습 데이터를 나눠서 처리를 해야죠. 그럼 GPU를 많이 사면 해결이 될까요? GPU를 1천장 정도 사용을 하면 학습도 정확히 1천배 빨라질까요? 실제로는 그렇지 않습니다. GPU가 많아질수록 계산 능력은 늘어나지만 각 GPU가 혼자 계산한 결과를 다시 서로 맞춰 봐야 하는 일도 함께 늘어나기 때문인데요. 그러니까 GPU 한 장의 속도랑 GPU 천장의 속도는 전혀 다른 문제입니다. AA의 학습은 모델이 낸 답과 정답의 차이를 보고 모델 내부의 수많은 숫자를 어느 방향으로 얼마나 고칠지 계산하는 과정인데요.이 수정 방향을 그레디언트라고 합니다. 여러 GPU가 서로 다른 학습 데이터를 처리를 하게 되면 각자 조금씩 다른 그레디언트를 계산을 하는데요. GPU마다 자신의 값만 사용을 하면 서로 다른 모델로 갈라지기 때문에 다음 학습 단계로 넘어가기 전에 각자의 계산 결과를 합쳐서 같은 모델을 유지를 해야 하죠.
여러 GPU의 값을 합친 뒤에 동일한 결과를 다시 모두에게 전달하는 연산이 오일 위스입니다. 예를 들어서 GPU네 장이 각각 1 2 3 4라는 값을 계산을 했다면네 가지의 값을 합친 결과를 모든 GPU가 다시 받아가는 방식이죠. GPU가 먼저 계산을 끝냈더라도 다른 GPU의 값이 도착하지 않으면 다음 단계로 넘어갈 수 없겠죠. GPU 수가 많아질수록 함께 일하는 작업자는 늘어나지만 한 명이 늦어졌을 때 기다려야 될 작업자도 많아집니다. 그렇다고 해서 모든 GPU가 다른 모든 GPU에게 데이터를 직접 보내면 될까요? GPU가 몇 장 안 될 때는 가능할 수도 있지만 수백장이랑 수천장으로 늘어나게 되면 연결이랑 데이터 복사가 지나치게 복잡해집니다. 그래서 데이터를 작은 조각으로 나눠서 옆 GPU로 순차적으로 전달을 하는 링 방식이라든가 여러 단계의 가지를 따라서 모으고 다시 배포하는 트리 방식을 사용을 하게 되는데요. 어떤 방식이 더 빠른지는 데이터 크기랑 GPU의 수, 서버의 연결 구조에 따라서 달라지게 됩니다.
이런 여러 GPU 통신을 처리를 하는 MBDI의 라이브러리가 NCCL입니다. 큐다가 GPU 안에 수많은 연상기에게 일을 나누는 체계라면 NCCL은 여러 GPU가 서로 값을 주고받는 순서를 관리를 하는 체계인 거죠. 그런데 통신 순서를 아무리 잘 짜도 데이터가 지나가는 물리적인 통로가 줬다면 속도는 나오지 않겠죠. 이제의 GPU 안의 문제가 GPU 사이의 문제로 바뀌게 됩니다. 일반적인 서버에서는 GPU랑 CPU, SSD, 네트워크 카드가 PCI 엑스프레스라는 통로로 연결이 되는데요. 여러 종류의 장치를 연결할 수 있는 범용 규격이지만 대규모 AI 학습에서는 GPU들이 서로 대량의 데이터를 반복적으로 교환을 해야 합니다. 그래서 엔비디아는 GPU 사이의 전용 고속 통로인 NB 링크를 개발을 했죠. 하지만 GPU 수가 늘어나게 되면 또 다른 문제가 생기는데요. GPU 두 장을 연결하는 건 그닥 어렵지 않지만 여덟 장이랑 수십장의 GPU를 모두 서로 직접 연결을 하려면 선의 수와 배선이 지나치게 복잡해집니다.
그래서 중간에서 어느 GPU의 데이터를 어디로 보낼지 연결을 하는 교환 장치가 들어가게 되는데 이것이 바로 MB 스위치인 거죠. MB 링크가 GPU 사이에 고속 통로라면 MB 스위치는 수많은 통로를 이어주는 환승 센터입니다. 중요한 점은 GPU들이 더 이상 각각 떨어진 그래픽 카드가 아니라 하나의 더 큰 계산 장치처럼 연결이 되기 시작했다는 거예요. 이렇게 한 서버나 한 렉 안에 GPU를 매우 빠르게 묶어서 더 큰 계산 장치처럼 만드는 거를 스케일업이라고 합니다. 그런데 GPU가 늘어날수록 전력 공급이랑 냉각이 어려워지고 스위치랑 케이블이 차지하는 공간도 더 커지기 때문에 한 렉의 GPU를 무한히 넣을 수는 없습니다. 더 큰 모델을 위해서는 결국 여러 서버랑 렉을 다시 연결을 해야 하죠. 이렇게 렉 밖으로 범위를 넓혀서 많은 서버를 하나의 클러스터로 묶는 거를 스케일 아웃이라고 합니다. 두 기술은 같은 네트워크처럼 보여도 맞는 문제가 다른데요. 렉 안에서는 가까이 있는 GPU들이 매우 높은 대역폭으로 촘촘하게 값을 교환해야 하고 렉 밖에서는 더 먼 거리에 있는 수많은 서버를 낮은 지연 시간으로 안정적으로 연결해야 하죠.
엔비디아는 렉 안에서는 MB 링크랑 MB 스위치를 갖고 있었습니다. 그런데 케이블이 렉 밖으로 나가는 순간 GPU 회사만으로는 해결하기 어려운 기술이 필요했던 거죠. 여기서 바로 멜라노스가 등장을 하게 됩니다. 멜라노스는 인피니 밴드랑 고성능 이더넷 네트워크 어댑터랑 스위치 기술을 갖고 있던 회사인데요. 엔비디아가 멜라녹스를 인수를 했을 때는 단순히 그냥 사업 영역을 좀 넓힌 것으로 볼 수도 있었지만 AI 클러스터의 구조를 따라가다 보면 인수의 이유가 조금 다르게 보입니다. GPU가 빨라지고 GPU 수가 늘어날수록 데이터가 서버 사이를 이동하는 시간이 전체 성능에서 더 큰 비중을 차지를 하는데요. 엔비디아가 생성형 AI 폭발을 정확히 예언했다고 말할 수는 없겠지만 당시에도 슈퍼 컴퓨터랑 대규모 데이터 분석에서는 계산 장치가 빨라질수록 네트워크가 성능을 제한한다는 문제가 분명히 있었습니다. 엔비디아는 GPU의 다음 병목이 렉 안에 네트워크로 이동할 가능성에 일찍 들어가게 된 거죠. 그런데 인피니 밴드는 단순히 인터넷선을 더 빠르게 만든 걸까요?
여기에는 데이터가 이동하는 방식의 차이가 좀 있는데요. 일반적인 데이터 이동에서는 CPU가 데이터를 시스템 메모리로 복사를 하고 네트워크 카드에 전송을 지시를 합니다. 반대편에서도 네트워크로 들어온 데이터가 CPU랑 시스템 메모리를 거쳐서 GPU로 다시 옮길 수 있기 때문에 GPU끼리 데이터를 한 번 교환을 하는데 중간 단계가 여러 번 생기게 되죠. 규모가 작을 때는 이게 감당할 수 있지만 GPU 수천장이 학습 단계마다 값을 교환하게 된다면이 복사랑 CPU 개입도 쌓이게 되는데요. 그래서 네트워크 장치가 상대 시스템의 메모리랑 직접 데이터를 교환을 해서 CPU 개입을 줄이는 기술을 사용을 하는데요. 이거를 RDMA라고 합니다. 엔비디아는이 경로를 GPU 메모리까지 연결을 한 GPU 다이렉트 RDMA를 제공을 하죠. GPU가 계산을 끝냈는데 CPU가 데이터를 옮겨 줄 때까지 기다리는 구간을 줄이는 기술이에요. 그러니까 GPU를 더 빠르게 만든 것이 아니라 GPU가 계산을 하지 않는 시간을 줄인 겁니다.
최근 ME 모델에서는 통신 방식도 더 복잡해지는데요. MEO는 모델 안에다가 여러 전문가 역할에 승경망을 두고 입력마다 필요한 일부 전문가만 선택을 해서 사용하는 구조죠. 계산량을 줄일 수 있다는 장점이 있지만 선택된 전문가들이 서로 다른 GPU에 있다면 입력을 해당 GPU로 보내고 결과를 다시 받아야겠죠. 앞에서 설명한 올리스가 여러 GPU의 값을 하나로 합치는 통신이었다면 여기서는 여러 GPU가 서로 다른 데이터를 주고받는 올투 올 통신이 늘어납니다. AI 모델의 구조가 바뀌면 GPU 안에 계산뿐만이 아니라 데이터가 어느 GPU에서 어느 GPU로 이동을 하는지도 함께 달라지게 되는데요. 네트워크는 GPU를 연결하는 부속품이 아니라 모델의 실제 성능을 결정을 하는 계산 시스템의 일부가 돼 버리는 거죠. 자, 여기까지 오면 엔비디아에는 GPU랑 쿠다, GPU 사이의 연결, 그리고 서버 사이에 네트워크가 모두 생겼습니다. 그러면이 부품들을 고객이 알아서 그냥 조립하면 끝일까요? 그렇지 않습니다. 어떤 CPU랑 메모리를 사용을 할지, GPU랑 스위치를 어떤 순서로 연결할지도 결정을 해야 하죠.
전원이랑 냉각도 맞춰야 되고 드라이버랑 운영 체제, 쿠다랑 통신 라이브러리 조합도 검증을 해야 하고요. 빠른 부품을 모두 모았다고 시스템 전체가 자동으로 빨라지는게 아니에요. 좋은 부품을 갖는 것이라 그 부품들이 안정적으로 함께 작동하는 건 또 다른 기술입니다. 여기서 등장한 제품이 바로 DGX인데요. 엔비디아는 2016년 DGX1을 공개를 하면서 GPU 여덟장이랑 MB링크, CPU랑 저장 장치, 그리고 딥러닝 소프트웨어를 하나에 검증된 시스템으로 쫙 묶었습니다. DGX의 의미는 그래픽 카드 여러 장을 한 상자에 넣었다는데 있는 것이 아니라 고객이 여러 회사의 부품을 직접 조합을 하고 성능이 나오지 않은 이유를 하나씩 하나씩 찾는 대신에 엔비디아가 정한 기준 시스템에서 시작을 하도록 만들었다는데 있습니다. 엔비디아는 그 이후에 GPU의 데이터를 공급하는 CPU랑 네트워크 스토리지 작업을 맞는 DPU 그리고 서버 보드랑 렉 설계까지 범위를 넓혔는데요. 뭐 여러분이 각각의 제품명을 모두 외우실 필요는 없고요.
역할만 연결을 해서 보면 됩니다. 자, HBM은 GPU 바로 옆에서 데이터를 공급을 하고 MB 링크랑 MB 스위치는 렉 안에 GPU들을 묶죠. 인피니 밴드랑 고성능 이더넷은 서버랑 렉 사이에 데이터를 옮기고 CPU랑 DPU는 시스템 관리랑 네트워크 저장 장치 같은 주변 작업을 나눠서 맞습니다. 소프트웨어는이 하드웨어들이 언제 어떤 데이터를 어느 경로로 처리를 할지 조율 하는 거고요. 그러니까이 모든 기술이 향하는 목표는 GPU가 메모리랑 다른 GPU CPU의 복사랑 네트워크를 기다리는 시간을 줄이는 겁니다. 엔비디아가 판매하는 거는 점점 GPU의 최고 연산량만이 아니라 그 연산량을 실제로 꺼내 쓰기 위한 조건 전체가 됐습니다. 그런데 시스템을 깊게 통합하면 통합할수록 NBDI는 새로운 고민도 생기게 되는데요. 구글이랑 아마존, 마이크로소프트 같은 대형 고객들이 자기네들의 자체 CPU랑 AI 가속기를 만들기 시작했기 때문이에요.이 회사들이 데이터 센터의 모든 계산칩을 NBDI의 제품으로 채울 가능성은 그닥 높지 않겠죠.
엔비디아는 여기에 다른 회사가 설계한 맞춤형 CPU랑 AI 가속기를 자사의 MB링크 연결 기술이랑 렉 구조에 결합을 할 수 있도록 하는 MB링크 퓨전이라는 전략을 내놓았습니다. 여기에서 XPU는 GPU만을 뜻하지 않고요. 기업이 특정 목적에 맞게 만든 여러 종류의 가속기를 넓게 아우어서 부르는 표현입니다.이 전략이 실제 시장에서 얼마나 널리 세택될지는 파트너 제품이랑 클라우드 도입을 확인을 해야 하지만 엔비디아가 뭘 지키려고 하는지는 잘 보이죠. 칩을 다른 회사가 만들었다 하더라도 칩들이 연결되는 시스템의 규칙에는 반드시 M비DI 기술이 들어가게 하려는 겁니다. 물론 통합된 시스템에는 반대편도 있습니다. 하드웨어랑 소프트웨어 조합이 검증이 되어 있어서 시스템을 빠르게 구축할 수도 있지만 한 회사에 대한 의존도 그만큼 높아지게 되는데요. 쿠다랑 엔비디아 라이브러리에 맞춰서 만든 코드를 다른 가속기로 옮기려면 수정이랑 검증이 필요하고 네트워크랑 서버 관리 도구까지 함께 사용을 했었더라면 교체 범위는 더 넓어지게 되겠죠.
가격 역시도 GPU 한 장만 볼 것이 아니라 스위치랑 네트워크 카드, 서버랑 전력, 냉각, 소프트웨어 운영비까지 포함을 해야 하고요. 비싼 시스템이라도 GPU가 높은 비율로 계속 계산을 하게 된다면 작업당 비용은 낮아질 수 있는데요. 반대로 실제 작업이 시스템을 충분히 활용하지 못한다면 비싼 GPU가 데이터를 기다리면서 놀게 되겠죠. 그래서 모든 AI 작업에 가장 크고 복잡한 엔비디아 시스템이 필요한 건 아니에요. 특정 작업이 반복이 되고 모델 구조가 충분히 고정되어 있다면 필요한 기능에 집중을 한 전용 칩이 더 낮은 비용이란 전력으로 처리를 할 수도 있습니다. 자, 그럼 엔비디아의 진짜 해자는 GPU일까요? 시스템일까요? 이거를 둘 중에 딱 하나만 골라야 하는 질문으로 보면 답을 놓치게 됩니다. 강한 GPU가 없었다면 쿠다 생태계랑 연결 기술도 지금과 같은 가치를 갖기 어려웠겠지만 또 좋은 GPU 한 장만으로는 수천장을 실제 학습에 사용할 수도 없어요. 엔비디아가 만들어 온 구조의 핵심은 GPU가 계산하는 시간을 늘리고 메모리랑 다른 GPU 그리고 CPU랑 네트워크를 기다리는 시간을 줄이는데 있습니다.
강한 GPU를 중심으로 해서 소프트웨어랑 메모리, 통신이랑 네트워크, 서버 설계가 서로의 가치를 더 높이도록 만든 구조. 이것이 바로 엔비디아 시스템 해자에 더 가까운 설명입니다. 그런데 이렇게 완성도가 높은 시스템이 있는데도 구글은 TPU를 만들고 있죠. 아마존은 트라니움, 마이크로소프트는 마이아, 메타도 자체 AI 가속기를 개발을 하고 있고요.이 기업들이 엔비디아 GPU랑 쿠다를 그대로 복재를 하려는 건 아니에요. 자신들의 데이터 센터에서 반복되는 특정 작업에 맞춰서 필요하지 않은 기능은 좀 덜어내고 비용이랑 전력 효율을 그만큼 높인 전용 칩을 만들고 있는 겁니다. 자, 그렇다면 빅테크의 자체 칩은 엔비디아를 완전히 대체를 하려는 걸까요? 아니면 엔비디아 시스템을 계속 사용을 하면서 비용이 큰 일부 작업만 자신들의 칩으로 가져오려는 걸까요? 다음 시간에는 GPU랑 AD 회로 구조랑 비용 측면에서 뭐가 다른지, 구글 TPU랑 빅테크의 자체 칩이 어떤 조건에서 유리해질 수 있는지 그걸 한번 살펴보도록 하겠습니다.
그럼 오늘은 여기까지 패치였습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 YouTube 안될공학 (IT/테크)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기