엔비디아 없이 AI 칩 가능한가? GPU·TPU·xPU 경쟁 속 진짜 셈법 분석
요약
본 기사는 엔비디아 의존도를 낮추려는 빅테크 기업들의 자체 AI 칩 개발 동향을 분석합니다. GPU가 범용성을 가지면서도, 실제로는 행렬 연산 같은 AI 전용 계산에 특화된 전용 회로(Tensor Core 등)를 내장하고 있음을 설명합니다. 또한 데이터 정밀도 조절 및 스레이(SRAM) 활용 등 칩 설계의 핵심 기술적 측면을 다룹니다.
핵심 포인트
- GPU는 범용성을 가지지만, AI 계산에 특화된 전용 회로가 내장되어 있다.
- 빅테크 기업들은 자체 사용 패턴에 맞춰 최적화된 AI 칩(TPU 등)을 개발한다.
- 데이터 정밀도 조절(FP8 등)과 스레이 활용은 칩 효율성을 높이는 핵심 기술이다.
Video: 엔비디아 없이 AI 칩 가능한가? GPU·TPU·xPU 경쟁 속 진짜 셈법 분석
Channel: 안될공학 - IT 테크 신기술
Duration: 15m 37s
Source: subtitle (auto, ko)
Transcript:
네, 여러분 안녕하세요. 패치입니다. 지금까지의 친문학에서는 AI 반도체를 하나씩 넓혀가면서 살펴봤는데요. 1강에서는 왜 CPU보다 GPU가 AI 계산에 잘 맞는지 알아봤고요. 2강에서는 GPU만 빨라서는 안 된다는 이야기를 했었죠. 계산에 필요한 데이터를 빠르게 가져오려면 HBM이랑 패키징도 중요하니까요. 3강에서는 M비디아의 힘이 GPU 한 장에서 끝나지 않는다는 걸 봤습니다. 쿠다랑 MB링크, 네트워크, 서버까지 하나의 시스템으로 묶여 있었죠. 그러면 이제 이런 질문이 생기는데요. 구글이나 아마존처럼 돈도 많고 데이터 센터도 직접 운영하는 회사가 자기 AI 칩을 만들면 과연 엔비디아를 대체할 수 있을까요? 구글은 올해 8세대 TPU를 공개했습니다. 이번에는 칩이 하나가 아닙니다. 대규모 학습에 맞춘 TPU AT랑 추론이랑 강화 학습에 맞춘 TPU 8i를 따로 만들었습니다. 그런데 같은 구글이 엔비디아의 차세대 베라루빈 시스템도 구글 클라우드에 공급을 할 예정입니다. 자체 칩을 벌써 8세대까지 만든 회사가 엔비디아 GPU도 계속 사는 겁니다.
오늘은 단순히 TPU랑 GPU의 성능 숫자를 비교하는 이야기가 아닙니다. 빅테크의 자체가 어떤 일에서 엔비디아 GPU를 대신할 수 있는지, 자체 칩을 만들 때 칩보다 더 어려운 문제는 무엇인지 그리고 엔비디아는 여기에 어떻게 대응을 하고 있는지까지 한번 보겠습니다. 먼저 GPU는 범용이고 TPU나 MPU는 AI 전용이라고 많이 설명을 하죠. 그런데 지금의 엔비디아 GPU를 보면이 구분이 그렇게 간단하지가 않습니다. GPU 안에도 이미 AI 계산에 맞춘 전용 회로가 많이 들어가 있기 때문인데요. AI 모델에서는 커다란 숫자표를 서로 곱하는 계산이 계속 나옵니다. 이거를 제임이라고 하는데요. 트랜스포머에서 퀄리키 밸류를 만들 때도 쓰고요. 어텐션이라든가 MLP에서도 이런 행렬이 반복이 됩니다. 엔비디아도이 계산을 일반 큐다 코어에만 맡기지는 않아요. 2017년 볼 텐서 코어는 행렬을 빠르게 처리하기 위해 만든 전용 연상기이죠. 작은 행렬 여러 개를 한꺼번에 곱하고 더합니다. 텐서 코어만 떼놓고 보면 GPU 안에도 작은 MPU가 들어 있다고 볼 수 있는 거죠.
AI 모델이 커지면서 숫자를 몇 비트로 표현하느냐도 중요해졌습니다. 16비트 숫자를 8비트로 줄이면 같은 메모리에 더 많은 값을 넣을 수 있어요. 칩 안에서 옮겨야 하는 데이터도 줄어들고요. 대신 숫자를 너무 단순하게 줄이면 결과가 틀릴 수 있습니다. 엔비디아가 호퍼부터 본격적으로 사용한 트랜스포머 엔진은 이걸 조절해 주는 기능인데요. 정확도가 많이 필요한 계산은 더 높은 정밀도로 처리를 하고 낮은 정밀도로 계산해도 되는 부분은 FP8 같은 형식을 사용을 합니다. 블랙웰에서는 이것보다 더 낮은 정밀도의 형식까지 지원을 하고요. 지금의 GPU는 여러 가지 일을 처리를 할 수 있는 장점을 남겨 두면서 자주 나오는 AI 계산은 전용 회로로 빠르게 처리합니다. 구글은 자주 쓰는 AI 계산을 하드웨어에 더 강하게 맞춰 놓는데요. 대표적인 것이스레이입니다. 행렬을 계산을 할 때 데이터를 매번 메모리로 돌려보내지 않고 여러 연상기 사이로 차례대로 흘려보내는 건데요. 앞에서 사용한 데이터를 바로 옆에 연상기가 다시 쓰는 식이죠.
같은 형태의 행렬 계산을 계속 반복할 때는 이게 아주 효율적입니다. 대신 칩을 만들 때부터 어떤 계산을 자주하게 될지 어느 정도 알고 있어야 하는 거죠. 여기에 자체의 장점이 있습니다. 구글은 재미나이가 어떤 계산을 많이 하는지 압니다. 메타도 자사의 추천이란 광고 모델이 하루에 얼마나 많은 출론을 반복을 하는지 어떤 연산이 가장 많이 쓰이는지 정확히 알고 있고요. 다른 회사가 만든 모든 프로그램을 다 받아 줄 필요도 없습니다. 자기 회사에서 많이 쓰는 기능에다가 칩의 공간을 더 많이 줄 수 있는 거죠. 이렇게 보면 AI에 맞춰서 칩을 더 디테일하게 만들수록 무조건 좋을 것 같습니다. 그런데 구글이 오래 보여준 방향은 오히려 더 복잡한데요. AI 전용 칩인 TPU를 다시 두 종류로 나눴습니다. 왜냐하면 학습할 때랑 실제 서비스를 돌릴 때 칩이 느려지는 이유가 서로 다르기 때문입니다. 학습할 때는 수천 개의 칩이 하나의 큰 계산을 오랫동안 나눠서 처리를 하는데요. 한 사람에게 몇 밀리초 빨리 대답하는 것보다 수천개의 칩이 쉬지 않고 계속 계산을 하게 만드는 것이 더 중요하죠.
반면 추로는 모델이 사용자에게 답을 만들어 주는 과정입니다. AI는 답을 한꺼번에 내놓지 않죠. 토큰을 하나씩 하나씩 이어붙이면서 문장을 만듭니다. 앞에서 읽은 내용을 매번 처음부터 다시 계산을 하면 너무 느리기 때문에 그 정보를 KB캐시에다가 저장을 해 두고 계속 읽죠. ME 모델에서는 토큰마다 필요한 전문가를 고릅니다. 그 전문가 엑스가 다른 칩에 있다면 데이터도 칩 사이를 움직여야 하고요. 둘 다 AI 계산이지만 칩이 실제로 하는 일은 꽤 다르죠. 그래서 TPUAT는 대규모 학습에 맞춰졌습니다. 행렬을 처리를 하는 장치뿐만이 아니라 다른 종류의 계산을 맞는 VPU도 들어가는데요. 거대한 인베린표를 불규칙하게 읽는 작업은 스파스코어가 따로 처리를 합니다. 아, 참고로이 이름들을 모두 외울 필요는 없습니다. 구글은 자기 모델에서 어떤 계산이 많이 나오는지 알기 때문에 자주 나오는 계산마다 잘 맞는 회로를 따로 붙일 수 있는데요. TPUAT는 시스템 규모도 큽니다. 하나의 슈퍼팟에 최대 9,600개 칩을 연결하도록 만들었죠.
반면 출론용 TPU 8i는 자주 쓰는 데이터를 칩이에 두다가 더 신경을 썼습니다. 칩 안에 들어가는 빠른 메모리인 S램을 384MB까지 늘렸고요. 여러 칩의 계산 결과를 빠르게 모으는 장치도 따로 넣었습니다. 구글은이 통신 장치를 CAE라고 부르는데요. MOE 모델에서 데이터가 움직이는 시간을 줄이기 위해서 보드플라이라는 연결 방식도 사용을 했죠. TPU8는 많은 칩을 묶어서 큰 학습을 빠르게 끝내는데 맞췄고요. TPU8i는 답을 만들 때 칩이 기다리는 시간을 줄이는데 더 힘을 준 거라고 보시면 됩니다.이 장점은 곧 자체 칩의 약점과도 이어지는데요. 칩은 AI 모델이 바뀔 때마다 새로 만들 수가 없죠. 칩을 설계를 하고 검증을 한 뒤에 실제 데이터 센터에 넣기까지는 아주 오랜 시간이 걸립니다. 근데 그 사이에 새로운 어텐션 구조가 나올 수도 있고요. ME를 사용하는 방법이라든가 숫자를 줄이는 방식도 달라질 수가 있습니다. 2년 전에는 중요했던 전용 회로가 새 모델에서는 별로 쓸모가 없어질 수도 있는 거죠.
GPU는 이런 변화에 조금 더 빨리 대응을 할 수 있습니다. 왜냐하면 새로운 계산 방식이 나와도 소프트웨어랑 라이브러리를 바꿔 가지고 먼저 돌려볼 수 있기 때문이에요. 그래서 새로운 모델을 계속 시험하는 연구 단계에서는 GPU의 장점이 큽니다. 모델이랑 서비스 방식이 어느 정도 정해졌고 같은 계산을 아주 많이 반복한다면 그때부터는 이제 자체 칩의 장점이 커지겠죠. 자체 칩은 AI 기술이 막 바뀌는 시기보다는 정해진 일을 엄청난 규모로 반복을 할 때 더 큰 힘을 내게 됩니다. 메타의 MTIA가 이런 경우예요. 메타는 추천이란 광고 모델을 직접 만드는데요. 어떤 계산이 얼마나 자주 반복되는지도 잘 알고 있고요. 모든 종류의 AI 모델을 처리를 할 필요가 없기 때문에 메타비에서 많이 쓰는 계산에 딱 맞춰서 칩을 만들 수가 있죠. 마이크로소프트의 마이아는 애저의 AI 출론을 위해서 만든 칩니다. AWS의 트레이닝은 AWS 안에서의 학습이랑 추론을 더 싸게 처리하는데 초점을 맞췄고요. 안트로픽처럼 트라이니움을 실제로 많이 사용할 고객도 이미 있습니다.
여기에서 어느 칩의 플러스가 조금 더 높은지만 보면 우린 중요한 부분을 놓칠 수가 있어요. 칩을 만들어 놓은 다음에 그 칩을 계속 돌릴만큼 일이 맞느냐 이게 중요한 거죠.이 이 흐름에 오픈 AI도 들어왔는데요. 브로드컴이랑 함께 만든 자체 출론 용침 할라피뇨입니다. 오픈 AI는 채지T랑 코덱스를 직접 운영을 하죠. 어떤 계산이 많이 반복이 되는지, 메모리랑 칩 사이에서 데이터가 어떻게 움직이는지, 그리고 네트워크 어디에서 시간이 걸리는지를 직접 볼 수 있습니다. 할라피뇨는 이런 실제 서비스의 특성에 맞춰 가지고 연산이랑 메모리, 네트워크의 균형을 잡은 칩이죠. 앞에서 자체 칩을 만들려면 그 칩을 계속 돌릴 일이 있어야 한다고 했죠. 오픈 AI에는 이미 채지T랑 코덱스가 있습니다. 특히 AI가 질문에 한 번 답하고 끝나는 서비스라면 모델도 몇 번만 실행하면 되죠. 그런데 AI가 코드를 만들고 직접 실행하고 결과를 확인하고 틀리면 다시 고치는 일을 맡기 시작을 하면 이제 이야기가 달라집니다. 사용자의 요청은 하나지만 그 일을 끝내기 위해서 모델은 여러 번 실행되니까요.
사용자의 수가 늘어나는데 더해서 사용자 한 명이 맡기는 일도 더 많은 계산을 요구하게 되는 거죠. 출론 비용을 낮추면 같은 돈으로 AI가 더 많은 단계를 거치고 더 오래 일할 수 있습니다. 그래서 할라피뇨는 M비디아 GPU 구매량을 줄이는 문제만으로는 볼 수 없는 거예요. 오픈 AI가 좋은 모델을 만드는 데서 그치지 않고 그 모델을 실제 서비스에서 더 싸고 많이 돌리려는 거죠. 물론 오픈 AI가이 모든 과정을 혼자 하는 건 아닙니다. 오픈 AI가 칩 구조를 설계를 하면 브로드컴이 실제 반도체 구현이랑 네트워크를 돕는 거죠. 셀레스티카는 보드와 렉 시스템을 맡고요. 현재 공개된 것은 엔지니어링 샘플이랑 초기 시험 결과입니다. 오픈 AI도 최종 성능을 아직 측정을 하고 있고 자세한 기술 보고서는 앞으로 공개를 하겠다고 밝혔습니다. 그런데 칩을 만드는 것만으로는 엔비디아를 대체를 할 수가 없습니다. 기존에 사용하던 AI 모델을 새로운 칩에서도 제대로 돌아가게 만들어야 하죠. 지난 3강에서 쿠다가 왜 엔비디아의 큰 장점인지를 살펴봤죠.
새 GPU가 나와도 개발자는 기존 파이톨치 코드랑 쿠다 라이브러리를 이용을 해 가지고 모델을 비교적 빠르게 옮길 수가 있습니다. 자체 칩을 만드는 회사는 이런 소프트웨어까지 직접 준비를 해야 해요. 구글에서는 XL A가 그 역할을 합니다. 컴파일러라는 말이 어렵게 들릴 수도 있는데요. 모델의 코드를 실제 칩이 빠르게 실행할 수 있는 형태로 바꿔 주는 프로그램입니다. XL A는 여러 계산을 살펴보고 따로 처리할 필요가 없는 작업은 하나로 합치죠. 예를 들어서 계산 A를 끝낸 뒤에 그 결과를 HBM에다가 저장을 하고 다시 불러와서 계산 B를 한다고 해 볼게요. 메모리다 쓰고 다시 읽는데 시간이 좀 걸리겠죠? XL A는 가능한 경우에는이 두 계산을 하나로 묶습니다. 그러면 중간 결과를 HBN까지 보냈다가 다시 가져올 필요가 없어지는 거예요. 이런 방식을 퓨전이라고 합니다. TPU를 아무리 잘 만들어도 기존 모델을 전부 TPU에 맞게 다시 작성을 해야 한다면 사용하기가 너무 어렵겠죠. XLA는 개발자가 작성한 모델이랑 실제 하드웨이어 사이에서 이런 차이를 줄여 줍니다.
같은 모델을 TPU에서 돌릴 수도 있고요. GPU에 맞게 보낼 수도 있고요. 그래도 구글은 M비디아 GPU를 함께 제공을 합니다. 새로운 모델을 빠르게 시험해야 하거나 쿠다로 만든 프로그램을 사용을 해야 한다면 엔비디아 GPU가 편하죠. 반대로 재미나이처럼 구글이 모델과 데이터 센터를 모두 관리를 하고 같은 계산을 아주 많이 반복하는 곳에서는 TPU의 장점이 커집니다. 구글이 TPU 8세대를 만들면서 베라루빈도 함께 제공하는게 이상한 일이 아니에요. 두 칩이 필요한 자리가 서로 다르기 때문이죠. 엔비디아 입장에서는 좀 불편한 흐름이 시작된 것도 맞습니다. 구글이랑 아마존, 마이크로소프트, 메타가 회사 안에서 반복되는 작업부터 자기네 자체 칩으로 옮기게 되면 엔비디아 GPU가 맞던 물량도 일부 줄어들 수 있으니까요. 그리고 엔비디아도이 변화를 눈여겨 보고 있습니다. 그래서 고객이 자체 칩을 만들더라도 그 칩이 엔비디아의 다른 기술을 사용하게 만드는 방향으로 움직이고 있죠. 대표적인 기술이 MB링크 퓨전인데요.
지난 3강에서 MB 링크는 M비디아 GPU 여러 개를 빠르게 연결을 해서 하나의 커다란 컴퓨터처럼 사용하는 기술이라고 설명을 했죠. MB 링크 퓨저는이 연결 기술을 M비디아 GPU 밖으로 넓힌 겁니다. 고객이 직접 만든 XPU나 CPU도 MB 링크랑 MB링크 스위치에 연결을 할 수 있죠. 고객이 연산 칩은 직접 만들더라도 그 칩을 수십개에서 수백개까지 묶는 연결 기술은 엔비디아가 제공을 하는 겁니다. AWS랑 M비디아의 관계가 이거를 잘 보여주고 있는데요. 아마존은 트레니엄움이라는 자체 AI 칩을 계속 키우고 있죠. 그러면서도 엔비디아랑 MB링크 퓨전 협력을 진행을 하고 있고요. 트레니움 4부터는 아마존의 칩이랑 Nv디아 GPU를 공통 렉 구조 안에서 연결을 할 수 있도록 협력할 계획입니다. 자체 칩이랑 엔비디아를 두고 꼭 둘 중 하나를 골라야 하는 그런 관계는 아닌 거죠. 엔비디아는 최근 여기에다가 NV HBM까지 추가를 했는데요. 지금의 HBM 시스템에서는 메모리를 제어하는 회로가 XPU 쪽에 들어가죠.이 회로가 바로 XPU의 공간을 차지를 하는 거죠.
MVHBM은이 기능을 HBM 아래에 있는 베이스 다이 쪽으로 옮기려는 구조인데요. 그렇게 되면 고객이 자체 XPU를 만들 때 더 많은 공간을 실제 연산 회로에 사용을 할 수가 있습니다. 엔비디아는 표준 HBM 4랑 비교를 해 가지고 XPU의 연산 다입 면적을 최대 25% 더 확보를 하고요. 메모리 대역폭은 최대 30% 높이고 HBM 전력은 최대 15% 낮출 수 있다고 주장을 합니다. 이건 물론 아직 앞으로 나올 기술에 대한 MBDI의 목표치이고요. 실제 제품의 구성이랑 성능은 출시 후에 확인을 해 봐야겠죠. XPU랑 XPU를 연결할 때는 MB링크 퓨전 그리고 XPU랑 HBM을 연결할 때는 MBHBM을 사용을 하게 만들려는 엔비디아의 큰 그림입니다. 고객이 연산 칩을 직접 만들더라도 이렇게 되면 칩 주변의 연결이랑 메모리에서는 엔비디아 기술이 계속 사용이 될 수 있겠죠. 자, 지난 3강에서는 엔비디아 GPU를 중심으로 큐다랑 MB링크 그리고 네트워크가 묶긴 시스템을 살펴봤습니다. 이번에는 그 가운데에 있는 GPU가 고객의 자체 XPU로 바뀌어도 그 주변에 엔비디아 기술을 남길 수 있는지를 보는 건데요.
물론 모든 회사가이 방법을 선택하는 건 아닙니다. 구글은 TPU만 직접 만든 회사가 아니죠. 칩이랑 칩을 연결하는 ICI도 만들고 데이터 센터 네트워크도 직접 설계를 하고요. XLA A 같은 소프트웨어도 가지고 있습니다. 칩부터 소프트웨어랑 네트워크까지 직접 만들 수 있는 회사라면 엔비디아 기술을 훨씬 적게 사용할 수 있겠죠. 그런데 이걸 할 수 있는 회사는 많지 않습니다. 칩계비만 많이 드는게 아니고요. 모델이 바뀔 때마다 컴파일러랑 커널도 고쳐야 하고요. 칩 수천개를 연결할 네트워크도 만들어야 되고요. 그렇게 만든 시스템을 쉬지 않고 돌릴만큼 많은 일도 필요합니다. 그래서 구글이랑 메타 AWS, 마이크로소프트, 오픈 AI처럼 자체 서비스랑 대규모 컴퓨팅 수요를 가진 회사들이 자체집에 투자를 할 수 있는 겁니다. 일반 기업이 어 엔비디어 GPU가 비싸니까 우리도 A식을 만들자. 이렇게 해서 시작하기는 어렵겠죠. 여기에다가 HBM도 함께 봐야 합니다. 자체 XPU가 늘어난다고 HBM 수요까지 사라지는 건 아니에요.
구글 TPU랑 AWS 트레늄, 마이크로소프트, 마이아 같은 자체 가속기도 데이터를 빠르게 가져오기 위해서 HBM을 사용을 하죠. 가속기 시장에서 비디아 GPU가 차지하는 비중이 줄어들더라도 그 자리를 차지한 XPU가 다시 HBM을 요구할 수도 있는 겁니다. MVHBF처럼 베이스 다이에다가 더 많은 기능을 넣는 방식이 늘어나면 메모리 회사가 해야 할 일도 달라질 수 있어요. 같은 HBM을 대량으로 만드는 데서 끝나는게 아니라 고객의 XPU에 맞춰 가지고 베이스 다이를 설계를 하고 함께 검증을 하는 능력이 더 중요해질 수 있습니다. 아직 특정 국내 메모리 회사가 MBHBM을 얼마나 공급할지는 공개되지 않았는데요. M비디아는 여러 메모리 업체가 MBHBM을 공급할 수 있게 하겠다고 밝혔지만 회사별 계약이랑 실제 물량은 알려진 바 없습니다. 지금은 특정 회사의 직접 수혜까지 단정할 단계는 아닌 거죠. 자, 그럼 구글 TPU랑 빅테크의 자체 XPU가 엔비디아 GPU를 대체할 수 있을까요? 이제는이 질문 자체를 조금 다르게 봐야 할 것 같습니다.
M비디아 GPU가 한꺼번에 사라지는게 아니라 지금까지 GPU가 맡아왔던 일 가운데 반복이 많고 예측 가능한 작업부터 하나씩 하나씩 자체 칩으로 떨어져 나가고 봐야 할 것 같아요. 구글은 TPU로 아마존은 트레니움으로 메타는 MTIIA로 오픈 AI는 할라피뇨로 자기에게 가장 많이 필요한 계산을 직접 가져가기 시작했습니다. 그런데 재밌는 건 그렇게 가운데 연산 칩이 바뀌어도 그 주변에는 여전히 네트워크랑 HBM, 렉이랑 소프트웨어가 필요하다는 거죠. 그래서 앞으로 AI 반도체 시장을 볼 때는 누가 엔비디아보다 빠른 칩을 만들었나 이거보다는 GPU가 하던 일 가운데서 무엇이 자체 XPU로 넘어가고 있는지 그리고 그 시스템의 나머지를 누가 가져가는지를 보는게 더 중요해질 것 같습니다. 그러니까 엔비디아를 대체하는 하나의 칩이 등장한게 아니라 AI 컴퓨팅이라는 거대한 시스템이 여러 칩으로 나뉘기 시작을 한 거죠. 자, 그럼 오늘은 여기까지 패치였습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 YouTube 안될공학 (IT/테크)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기