Google, AI 에이전트를 위해 데이터 센터 하드웨어 재설계
요약
Google이 자율형 AI 에이전트의 폭발적인 추론 수요를 감당하기 위해 데이터 센터 아키텍처를 전면 재설계합니다. 맞춤형 TPU 칩과 고대역폭 메모리, 고급 네트워킹을 통합하여 에이전트 워크로드에 최적화된 인프라를 구축하는 것이 핵심입니다.
핵심 포인트
- 에이전트 워크로드는 기존 AI 작업보다 최대 100배 많은 추론 트랜잭션 발생 가능
- TPU-8t(훈련용) 및 TPU-8i(추론용) 등 맞춤형 실리콘 개발
- 고대역폭 메모리(HBM) 50% 증설을 통한 문맥 정보 처리 능력 강화
- 에이전트의 지속적 작동을 지원하는 탄력적이고 응집력 있는 시스템 구축
Google은 기본적인 대규모 언어 모델 (LLM)에서 자율형 AI 에이전트 (AI agents)로의 전환을 지원하기 위해 전 세계 데이터 센터 아키텍처를 전면 개편하고 있습니다. 이러한 변화에는 지속적이고 다단계적인 디지털 어시스턴트(digital assistants)에 필요한 방대한 규모의 처리를 감당하기 위해 맞춤형 실리콘 (custom silicon), 고급 네트워킹 (advanced networking), 그리고 특화된 소프트웨어를 통합하는 과정이 포함됩니다.
지속적인 AI 에이전트를 위한 기반 구축
단순한 챗봇 (chatbots)에서 자율형 에이전트 (autonomous agents)로의 전환은 컴퓨팅 수요 측면에서 거대한 변화를 의미합니다. 초기 AI 모델들이 단일 프롬프트 (prompts)에 답변하는 데 집중했다면, 에이전트들은 복잡한 작업을 완료하기 위해 지속적으로 작동합니다. 이러한 변화는 데이터 센터가 작동하는 방식에 대한 다른 접근법을 요구합니다. 최근 통계에 따르면 Google의 시설은 현재 매달 4,000조 개 이상의 토큰 (tokens)을 처리하고 있습니다. 이 수치는 전년 대비 7배 증가한 것으로, AI 도입이 가속화되는 속도를 잘 보여줍니다.
회사의 인프라 리더들은 에이전트가 단순히 사용자에게 응답만 하는 것이 아니라는 점에 주목합니다. 대신, 여러 에이전트가 단일 문제를 해결하기 위해 협업하는 경우가 많습니다. 이는 수백만 명의 사용자가 수십억 개의 자동화된 트랜잭션 (transactions)을 유발할 수 있는 연쇄 효과를 만들어냅니다. 추정치에 따르면 에이전트 워크로드 (agentic workloads)는 전통적인 AI 작업보다 100배 더 많은 추론 트랜잭션 (inference transactions)을 생성할 수 있습니다. 이를 관리하기 위해 회사는 탄력성 (elasticity)과 장기 운영을 우선시하는 시설을 위한 새로운 청사진을 만들었습니다.
업데이트된 데이터 센터 스택 (data center stack)을 통해 에이전트들은 다양한 지역에 널리 분산될 수 있습니다. 이러한 에이전트들은 지속적인 인간의 입력 없이도 장기간 작동 상태를 유지하며 독립적인 결정을 내려야 합니다. 목표는 개별 서버의 집합이 아닌, 하나의 응집력 있는 단일 기계처럼 작동하는 시스템을 구축하는 것입니다. 매년 새로운 하드웨어 플랫폼을 제공함으로써, 회사는 이러한 진화하는 디지털 엔티티 (digital entities)에 의해 발생하는 특정한 요구 사항보다 앞서 나가고자 합니다.
이러한 아키텍처 재설계의 주요 초점은 효율성 (Efficiency) 유지에 있습니다. 만약 에이전트가 빠르게 추론하고 행동할 수 없다면, 비즈니스 환경에서의 유용성은 감소합니다. 결과적으로, 오케스트레이션 계층 (orchestration layers)은 신속한 확장 (scaling)이 가능하도록 조정되었습니다. 이를 통해 에이전트가 계산을 수행해야 하는 정확한 시점에 기반 인프라의 전력을 사용할 수 있도록 보장하며, 작업 직후에는 자원을 절약하기 위해 즉시 해제합니다.
맞춤형 실리콘 및 고급 오케스트레이션 계층
이러한 새로운 소프트웨어 요구 사항을 지원하기 위해, 하드웨어 팀은 훈련 (training) 및 추론 (inference)에 최적화된 특수 칩을 개발했습니다. TPU-8t로 알려진 최신 훈련용 칩은 이전 세대보다 3배 더 높은 연산 능력을 제공합니다. 추론 작업을 위한 TPU-8i 칩은 에이전트가 작업하는 동안 활성 상태로 유지해야 하는 방대한 양의 데이터를 처리할 수 있도록 훨씬 더 많은 메모리를 포함하고 있습니다. 구체적으로, 새로운 하드웨어는 이전 버전과 비교하여 고대역폭 메모리 (high-bandwidth memory)가 50% 증가했습니다.
한 가지 중요한 기술적 개선 사항은 칩이 키-값 캐시 (key-value cache)를 처리하는 방식과 관련이 있습니다. 이 캐시는 에이전트가 긴 대화나 다단계 프로젝트를 수행하는 동안 정보에 입각한 결정을 내리는 데 필요한 문맥 정보 (contextual information)를 저장합니다. 이 정보의 더 많은 부분을 칩에 직접 저장함으로써, 시스템은 데이터를 외부 저장소로 주고받아야 하는 필요성을 줄입니다. 이러한 변화는 더 빠른 응답 시간과 트랜잭션당 더 낮은 운영 비용을 결과로 가져옵니다.
특화된 AI 칩 외에도, 회사는 Axion N4A 프로세서를 도입했습니다. 이 CPU는 도구 호출 (tool calling) 및 작업 오케스트레이션 (task orchestration)과 같이 에이전트를 구동하는 관리 작업을 위해 특별히 설계되었습니다. 이는 범용 프로세서보다 이러한 특정 역할에 대해 더 높은 전력 효율성을 제공합니다. 적절한 작업에 적절한 칩을 사용함으로써 데이터 센터는 전력 소비를 최소화하는 동시에 총 출력 (total output)을 극대화할 수 있습니다.
이러한 새로운 환경에서는 소프트웨어 오케스트레이션 (Software orchestration) 또한 똑같이 중요한 역할을 합니다. Google Kubernetes Engine은 에이전트 네이티브 (agent-native) 환경 역할을 수행할 수 있도록 수정되었습니다. 이를 통해 개발자는 보안 컨테이너 (containers) 또는 샌드박스 (sandboxes) 내에서 에이전트를 거의 즉각적으로 실행할 수 있습니다. 에이전트가 작업을 마치면 시스템이 자동으로 리소스를 회수합니다. 이러한 수준의 자동화는 에이전트 기반 워크플로 (agent-based workflows)에서 흔히 발생하는 예측 불가능한 활동 급증을 관리하는 데 필수적입니다.
네트워킹 혁신 및 업계 경쟁
수십만 개의 칩을 단일 컴퓨팅 패브릭 (computing fabric)으로 연결하려면 네트워킹 분야의 돌파구가 필요합니다. Virgo라고 불리는 새로운 기술은 이제 분산 네트워크 (distributed network) 전반에 걸쳐 최대 100만 개의 프로세싱 유닛 (processing units)을 조정합니다. 이 기술은 내부 하드웨어에만 국한되지 않으며, Nvidia와 같은 외부 파트너의 최신 고성능 칩과도 통합될 수 있습니다. 예를 들어, Virgo는 대규모 학습 작업을 위해 거의 960,000개의 GPU를 하나의 통합된 시스템으로 연결할 수 있습니다.
지연 시간을 더욱 줄이기 위해 TPUDirect라고 불리는 시스템이 구현되었습니다. 이를 통해 데이터가 스토리지 시스템에서 프로세싱 유닛의 메모리로 직접 이동할 수 있습니다. 전통적인 오케스트레이션 오버헤드 (orchestration overhead)를 우회함으로써, 시스템은 데이터 전송에 필요한 시간을 대폭 단축합니다. 또한, Pathways라고 불리는 분산 학습 프레임워크 (distributed training framework)는 수백만 개의 유닛에 걸쳐 머신러닝 (machine learning) 작업을 동시에 확장할 수 있도록 돕습니다. 이 프레임워크는 이전에 대규모 학습 속도를 늦췄던 일반적인 병목 현상 (bottlenecks)을 해결합니다.
업계 분석가들은 전체 스택 (stack)을 직접 제어하는 것이 이 회사에 독보적인 이점을 제공한다고 관찰합니다. 자체 칩을 설계하고, 소프트웨어를 작성하며, 물리적 데이터 센터를 관리하기 때문에 경쟁사들이 어려움을 겪을 수 있는 방식으로 모든 계층 (layer)을 최적화할 수 있습니다. 하지만 Amazon Web Services 및 Microsoft와 같은 다른 주요 클라우드 제공업체들도 속도를 맞추기 위해 자체 실리콘 (silicon)을 개발하고 있습니다. Nvidia가 범용 GPU 시장에서 지배적인 힘을 유지하고 있는 한편, 맞춤형 AI 하드웨어의 부상은 기업들을 위해 더욱 다양한 생태계를 조성하고 있습니다.
이러한 기술적 도약에도 불구하고, 전문가들은 기업들에게 클라우드 인프라에 대해 균형 잡힌 접근 방식을 유지할 것을 권고합니다. 아키텍처가 아무리 진보했더라도 단일 제공업체에 의존하는 것은 위험을 수반합니다. 멀티 클라우드 (multi-cloud) 전략은 조직이 잠재적인 시스템 장애나 가격 변동의 영향을 완화하는 데 도움을 줍니다. AI가 실험 단계에서 핵심 비즈니스 도구로 이동함에 따라, 토큰당 비용 (cost per token)과 기반 하드웨어의 신뢰성이 궁극적으로 어떤 플랫폼이 시장에서 승리할지를 결정할 것입니다.
데이터 센터의 진화는 기술 산업의 더 광범위한 트렌드를 반영합니다. 인프라는 더 이상 단순히 원시 전력 (raw power)을 제공하는 것에 그치지 않습니다. 그것은 복잡한 추론 (reasoning)에 필요한 특정 유형의 전력을 제공하는 것에 관한 것입니다. 에이전트 시대의 요구 사항을 충족하기 위해 아키텍처를 변환함으로써, Google은 AI가 단순한 도구가 아니라 디지털 워크플로 (workflows)의 능동적인 참여자가 되는 미래를 다룰 수 있도록 스스로를 포지셔닝하고 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기