
Nvidia의 Blackwell이 기밀 AI (Confidential AI)의 계산 방식을 바꾸는 이유
요약
Nvidia Blackwell 칩은 기밀 컴퓨팅(Confidential Computing) 환경에서도 일반 연산과 거의 차이 없는 압도적인 성능을 보여줍니다. 하지만 보안 영역과 GPU 간의 데이터 전송 과정에서 발생하는 연결부 병목 현상이 새로운 성능 저하의 원인으로 지목됩니다.
핵심 포인트
- Blackwell 칩은 기밀 AI 연산 시 일반 속도의 99.8% 수준을 유지함
- 하드웨어 자체보다 보안 영역과 GPU 간의 데이터 연결부에서 비용 발생
- vLLM 등 기존 AI 서빙 도구의 작업 중첩 기술이 기밀 환경에서는 역효과 유발
- 설정 최적화를 통해 비기밀 환경 속도의 8% 이내 수준까지 성능 향상 가능
참고: 이 기사는 2026년 7월 2일에 처음 게시된 Phala의 공식 블로그 포스트인 “TEE is Really Fast on Nvidia Blackwell”을 각색한 것입니다. 원본 연구 및 집필에 대한 모든 권한은 Phala 연구 팀에 있습니다.
해당 게시물 보기: https://phala.com/posts/blackwell-gpu-cc-serialized-bridge

Nvidia Blackwell에서 TEE는 정말 빠릅니다
기밀 컴퓨팅 (Confidential computing)은 항상 트레이드오프 (trade off)를 동반해 왔습니다. 프라이버시를 얻는 대신 속도로 대가를 치러야 했습니다. Phala 팀의 새로운 연구에 따르면, Nvidia의 최신 Blackwell 칩에서는 이러한 트레이드오프가 사라지기 시작하고 있으며, 실제 이야기는 단순히 이제 더 빨라졌다는 것보다 훨씬 더 흥미롭습니다.
칩은 더 이상 문제가 아닙니다
Nvidia의 B300 Blackwell 칩에서는 기밀 컴퓨팅 (confidential computing) 환경에서 AI 연산을 실행하는 데 비용이 거의 들지 않습니다. 모든 AI 모델의 기본 수학인 행렬 곱셈 (Matrix multiplication)은 일반 속도의 0.998배로 실행됩니다. 더 긴 실행 시간 동안에는 실제로 비기밀 (non-confidential) 속도와 일치하거나 이를 약간 능가했습니다. 수년 동안 사람들은 프라이버시가 곧 느림을 의미한다고 가정해 왔습니다. 이 하드웨어에서는 그 가정이 더 이상 유효하지 않습니다. 칩 자체는 더 이상 속도 저하의 원인이 아닙니다.
그렇다면 비용은 대신 어디로 향할까요?
그 비용은 시스템의 보안 영역과 GPU 사이의 연결부로 향합니다. 데이터가 해당 연결을 통해 이동할 때마다, 소프트웨어가 백그라운드에서 실행되고 있다고 판단하더라도 데이터는 한 번에 한 조각씩 이동하며 실제 설정 비용 (setup cost)을 지불해야 합니다. 이는 vLLM과 같이 널리 사용되는 도구들을 포함하여 많은 인기 있는 AI 서빙 (serving) 도구들을 조용히 망가뜨립니다. 이러한 도구들은 작업들을 중첩 (overlapping) 시켜 시간을 절약하려고 시도하지만, 기밀 컴퓨팅 (confidential computing) 환경에서는 그 기술이 오히려 역효과를 내어 지연 (delay)을 피하는 대신 추가하게 만듭니다. 한 테스트에서 단순히 해당 기본 설정을 끄는 것만으로도 성능이 초당 3550 토큰에서 4104 토큰으로 향상되었습니다. 더 심층적인 해결책을 적용했을 때는 초당 5518 토큰까지 끌어올려, 일반적인 비기밀 (non-confidential) 속도의 8% 이내 수준에 도달했습니다.
비용은 실행 중인 작업에 따라 달라집니다
모든 워크로드 (workload)가 동일한 대가를 치르는 것은 아닙니다. 가볍고 단순한 서빙은 속도 저하를 거의 느끼지 못합니다. 더 무겁고 지속적인 워크로드는 약 13~14%의 성능 손실을 겪습니다. 전문가 혼합 (Mixture of Experts, MoE) 모델과 캐시된 데이터 (cached data)에 크게 의존하는 작업은 동일한 연결을 통해 더 많은 데이터를 이동시키기 때문에 최대 27%까지 가장 큰 손실을 입습니다. 패턴은 일관적입니다. 데이터 이동이 많을수록 더 많은 비용이 발생합니다.
모델을 로드하는 과정에서도 정확히 동일한 패턴이 나타납니다. 1,200억 개의 파라미터 (parameter)를 가진 대규모 모델을 로드하는 일반적인 방식은 Blackwell 하드웨어에서 거의 5분이 소요되었습니다. 더 스마트한 로딩 방식을 사용하면 이를 약 8초로 단축할 수 있습니다. 이 차이가 기밀 AI (Confidential AI)를 실제로 실제 운영 환경 (production)에서 사용할 수 있는 단계로 취급할 수 있을지, 아니면 연구용 데모 수준에 머물게 할지를 결정합니다. 또한 이번 연구를 통해 기밀 워크로드가 서로 연결된 여러 개의 GPU 상에서 초당 510GB가 넘는 매우 높은 데이터 전송 속도로 실행될 수 있음을 확인했습니다. 이는 단일 칩뿐만 아니라 GPU 클러스터 전체를 함께 신뢰할 수 있는 방향으로 나아가는 진정한 진전입니다.
이것이 중요한 이유, 그리고 Phala가 돋보이는 이유
기밀 AI (Confidential AI) 분야에서 작업하는 대부분의 팀은 단순히 기술이 작동하게 만드는 데 집중하고 있습니다. 하지만 이 연구는 그보다 더 나아갑니다. 이 연구는 특정 상황에서 왜 기밀 컴퓨팅 (Confidential Computing)이 느려지는지 정확히 설명하며, 비용을 불가피한 것으로 받아들이는 대신 실제 원인을 어떻게 해결할 수 있는지를 보여줍니다. 이것은 매우 의미 있는 차이입니다. 이는 연구용 데모와 개발자 및 기관이 실제 워크로드 (Workload)를 위해 실제로 신뢰할 수 있는 것 사이의 차이입니다.
이러한 종류의 작업은 워크로드가 스케줄링되는 방식부터, 모델이 빠르게 로드되는 방식, 캐시된 데이터 (Cached data)가 처리되는 방식, 그리고 전체 GPU 클러스터 (GPU Cluster)가 함께 신뢰받을 수 있는 방식에 이르기까지, 향후 기밀 AI 시스템이 구축되어야 하는 방식을 직접적으로 형성합니다. 이는 기밀 AI가 틈새 옵션으로 남을 것인지, 아니면 AI 모델이 서비스되는 일반적이고 기대되는 방식이 될 것인지를 결정할 토대가 될 것입니다.
만약 당신이 AI 인프라 (AI Infrastructure)와 관련된 일을 하거나, 자신의 시스템을 위해 기밀 컴퓨팅 (Confidential Computing) 도입을 검토하고 있다면, 이 연구를 직접 읽어볼 가치가 있습니다. 전체 논문의 제목은 “The Serialized Bridge: Understanding and Recovering LLM Serving Performance under Blackwell GPU Confidential Computing”이며, 여기서 언급된 모든 결과에 대해 훨씬 더 깊이 있게 다루고 있습니다.
전체 논문은 여기에서 확인할 수 있습니다: https://arxiv.org/abs/2606.23969
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기