뉴스 라운드업: 오픈 소스 모델부터 더 저렴한 추론 비용까지
요약
AMD의 Helios 공개와 Nvidia의 아시아 시장 확장, Alibaba의 대규모 오픈 소스 모델 출시 및 Qualcomm의 Modular 인수 등 AI 인프라와 하드웨어 생태계의 주요 변화를 다룹니다.
핵심 포인트
- AMD Helios 출시로 Nvidia 독점에 대응하는 강력한 경쟁 구도 형성
- Nvidia의 아시아 파트너십을 통한 AI의 물리적 세계(공장, 로봇) 확장
- Alibaba Qwen3.8-Max 공개로 프런티어급 오픈 소스 모델 경쟁 가속화
- Qualcomm의 Modular 인수를 통한 CUDA 종속성 탈피 및 소프트웨어 스택 강화
AMD가 Nvidia를 직접 겨냥하다
무슨 일이 일어나고 있나요?
AMD가 Helios를 공개했습니다. 이는 72개의 MI455X GPU와 31TB의 메모리를 랙에 채워 넣은 구성으로, Microsoft, Meta, OpenAI, 그리고 Oracle이 이미 고객으로 계약을 체결했습니다.
왜 중요한가요?
Nvidia는 여전히 데이터 센터 GPU 시장의 약 95%를 점유하고 있습니다. 거물급 기업들의 지원을 받는 신뢰할 수 있는 경쟁자의 등장은 실질적인 경쟁을 의미하며, 결과적으로 대규모로 AI를 운영하는 모든 이들에게 더 나은 가격 책정을 의미합니다.
CometChat의 생각
랙당 더 많은 메모리를 갖추는 것은 실제 사용자에게 백만 토큰 컨텍스트 (million-token context)를 제공해야 하는 상황이 오기 전까지는 단순한 설비 문제처럼 들릴 수 있습니다. 인프라 경쟁은 당신이 실제로 출시할 수 있는 AI 기능이 무엇인지 조용히 결정하고 있습니다. 저희는 이를 면밀히 지켜보고 있습니다.
Nvidia, 아시아에서 5,000억 달러 규모의 AI 계약 체결
무슨 일이 일어나고 있나요?
Jensen Huang은 일본과 한국에서 2주를 보내며 공장, 로봇, 그리고 SK Group과 함께하는 2기가와트(2-gigawatt) 규모의 데이터 센터에 AI를 연결하기 위한 파트너십을 체결했습니다.
왜 중요한가요?
이것은 AI가 채팅창을 벗어나 공장, 기계, 국가 인프라와 같은 물리적 세계로 이동하고 있음을 의미합니다. 모든 것의 밑바탕이 되는 컴퓨팅 구축 규모가 훨씬 더 커졌습니다.
CometChat의 생각
로봇과 공장은 여전히 서로, 운영자에게, 그리고 루프 내의 인간(humans in the loop)에게 소통할 필요가 있습니다. 물리적 AI가 확장됨에 따라 조정 계층 (coordination layer)은 있으면 좋은 기능이 아니라 필수적인 요소가 됩니다. 그것이 바로 이 모든 것이 제대로 작동할지 여부를 결정하는, 다소 지루하지만 중요한 부분입니다.
Alibaba, 역대 최대 규모의 모델을 오픈 소스로 공개
무슨 일이 일어나고 있나요?
Alibaba가 2.4조 개의 파라미터(parameters)를 가진 Qwen3.8-Max를 출시했습니다. 이는 OpenAI 및 Anthropic의 최고 모델들과 경쟁할 만한 수준이며, 다음 주에 가중치(weights)가 오픈 소스로 공개될 예정입니다.
왜 중요한가요?
직접 다운로드하여 실행할 수 있는 프런티어급(frontier-class) 모델은 계산법을 바꿉니다. 벤더 종속성(vendor lock-in)은 줄어들고, 제어권은 늘어나며, 에이전트 기반 코딩(agentic coding) 및 연구를 위한 강력한 옵션이 됩니다.
CometChat의 생각
역량 있는 오픈 모델이 등장할 때마다 조용히 같은 질문이 던져집니다. "누가 이것을 프로덕션(production) 환경에서 운영하고 있는가?" 모델은 쉬운 부분입니다. 이를 실제 대화, 에이전트, 그리고 사용자에게 연결하는 과정이 실제 작업이 시작되는 지점이며, 보통 문제가 발생하는 지점이기도 합니다.
Qualcomm, CUDA에 맞서기 위해 Modular 인수
무슨 일이 일어나고 있나요?
Qualcomm이 Chris Lattner의 AI 소프트웨어 기업인 Modular를 39억 달러에 인수하며 계약을 완료했습니다. 이는 NVIDIA뿐만 아니라 어떤 칩에서도 AI를 실행할 수 있는 벤더 중립적(vendor-neutral) 계층에 베팅하는 것입니다.
왜 중요한가요?
CUDA 종속성(lock-in)은 수년 동안 팀들을 특정 벤더에 묶어두었습니다. 진정한 크로스 실리콘(cross-silicon) 소프트웨어 계층은 AI를 어디서, 얼마나 저렴하게 실행할지에 대해 더 많은 선택권을 의미합니다.
CometChat의 생각
흥미로운 싸움은 하드웨어에서 이를 사용 가능하게 만드는 소프트웨어로, 즉 스택(stack)의 상위 계층으로 이동하고 있습니다. 채팅과 에이전트의 경우도 마찬가지입니다. 칩 자체보다 칩을 사람들이 실제로 대화할 수 있는 무언가로 변환해 주는 계층이 더 중요합니다.
AMD, 추론 비용에서 Nvidia를 압도
무슨 일이 일어나고 있나요?
새로운 벤치마크에 따르면 AMD의 MI355X는 2.8조 개의 파라미터를 가진 Kimi K3 모델을 실행할 때, Nvidia B300의 토큰당 비용(per-token cost)보다 절반 이하의 비용으로 구동합니다.
왜 중요한가요?
Nvidia가 여전히 원시 처리량(raw throughput) 측면에서는 승리하고 있지만, AMD는 달러당 토큰 수(tokens per dollar) 측면에서 승리하고 있습니다. 프로덕션 환경에서 대규모 모델을 운영하는 누구에게나 이 계산은 빠르게 큰 차이를 만들어냅니다.
CometChat의 생각
추론 비용(Inference cost)은 AI 기능이 실제 사용 단계에 도달하기 전까지는 아무도 계획하지 않는 지루한 부분입니다. 채팅과 에이전트가 확장(scale)되면 비용도 함께 확장됩니다. 더 저렴한 토큰은 실제로 좋은 결과물을 출시할 수 있는 더 많은 여유를 의미합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기