Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

사후 학습과 고동시성 추론에 최적화된 새로운 TPU 8i 설계가 공개되었습니다. 온칩 SRAM 확대, 새로운 Collectives Acceleration Engine, 그리고 Boardfly 네트워크 토폴로지를 통해 성능을 극대화했습니다.
이 문서는 Virgo fabric에 대한 TPU 8t 랙 레벨 연결성의 조감도를 제공합니다. 이 아키텍처는 고방사율 스위치(high-radix switches)를 기반으로 구축되었으며, 네트워크 계층을 줄여 더 많은 포트를 허용하는 것이 특징입니다. 또한, 평면적인 2계층 비차단 토폴로지(two-layer non-blocking topology)를 채택하여 효율성을 높였습니다.
이번 라이브 스트림에서는 ADK(Agent Development Kit)를 활용하여 여러 에이전트를 오케스트레이션하고, NVIDIA RTX PRO 6000 GPU와 Cloud Run 환경에서 Gemma 4 모델을 서비스하는 방법을 다룹니다. 또한 Milvus를 사용하여 이러한 멀티 에이전트 애플리케이션을 연결하고 구축하는 과정을 소개할 예정입니다.
Google Cloud Next에서 소개된 내용을 바탕으로, ADK(Agent Development Kit)와 A2UI를 활용하여 에이전트 시스템의 사용자 경험을 혁신할 수 있습니다. 이 가이드는 사용자가 에이전트 시스템과 끊김 없이 상호작용할 수 있도록 직관적이고 고품질의 인터페이스 구축 방법을 제시합니다.
TPU 8t는 이전 세대 TPU 대비 여러 면에서 상당한 발전을 이루었습니다. 주요 개선 사항으로는 SparseCore의 도입, VPU와 MXU의 중첩 및 균형 잡힌 스케일링이 가능해졌으며, 네이티브 4비트 FP4 지원을 통해 효율성이 높아졌습니다. 또한, Virgo 네트워크 토폴로지 채택과 향상된 스토리지를 통해 데이터 처리 능력과 확장성이 크게 증가했습니다.
본 기사는 NVIDIA의 가속화된 스택을 활용하여 Google Cloud에 Gemma 4 모델 가족을 배포하는 '풀스택 추론(Full-stack inference)' 방법을 소개합니다. 이를 통해 대규모 환경에서 효율적으로 AI 모델을 운영하고 서비스할 수 있는 방안을 제시합니다.