Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
MI300X 환경에서 TSP 방식은 테스트된 모든 방법 중 가장 낮은 메모리 사용량을 보여줍니다. 특히 64K 컨텍스트에서는 가중치(weight)와 활성화(activation) 모두를 효율적으로 처리하여 기존 TP(Tensor Parallelism)의 장점과 SP(Sparsity Parallelism)의 장점을 결합합니다. 이로 인해 TSP는 높은 처리량(throughput)을 제공하며, 128K 토큰 컨텍스트에서 173M tok/sec라는 우수한 성능을 기록했습니다.
TSP(Throughput Scaling)는 기존의 EP 및 PP 방식과 함께 사용될 수 있는 새로운 접근 방식입니다. 이 기술은 1024 MI300X GPU와 128K 토큰 컨텍스트를 활용하여 모델 복사본당 높은 처리량을 제공하는 것이 특징입니다.
Zyphra Cloud는 AMD 기반의 풀스택 AI 플랫폼을 소개하며, 특히 긴 호흡의 에이전트 워크로드에 특화된 서버리스 추론 서비스를 제공합니다. 이 서비스는 프런티어 오픈 웨이트 모델을 지원하며, @TensorWave의 @AMD MI355X GPU를 기반으로 구동됩니다.
새로운 시각-언어 모델(Vision-Language Model, VLM)인 ZAYA1-VL-8B가 출시되었습니다. 이 모델은 AMD에서 학습된 ZAYA1-8B 베이스를 기반으로 구축되었으며, 700M active / 8B total MoE 구조를 채택했습니다. 이를 통해 모델 크기 대비 높은 성능과 뛰어난 지능 밀도 및 추론 효율성을 구현했다고 설명합니다.
ZAYA1-VL-8B는 소형 MoE(Mixture-of-Experts) VLM 중 하나로, 대부분의 VLM이 Dense 모델이고 다른 MoE VLM은 크다는 한계를 극복했습니다. 이 모델은 특히 멀티모달 환경에서 소규모 스케일로 학습시키는 것이 어렵다는 도전 과제를 해결했음을 보여줍니다.
Nvidia의 핵심 경쟁력은 독점 소프트웨어 플랫폼인 CUDA에 있습니다. DeepSeek는 중국 시장에서 Huawei 칩을 활용하여, Zyphra는 서구권에서 AMD를 통해 이 영역에 도전하고 있음을 보여줍니다. 특히 Zyphra는 AMD Instinct MI355 GPU 용량을 갖춘 풀스택 네오클라우드(neocloud)인 Zyphra Cloud의 출시를 발표했습니다.
AMD의 지원을 받는 풀스택 네오클라우드 솔루션인 Zyphra Cloud가 15MW 규모의 AMD Instinct MI355 GPU 용량을 제공함을 발표했습니다.