CoreWeave CTO Peter Salanki가 예측하는 AI 인프라 경제의 방향성
요약
CoreWeave CTO Peter Salanki가 AI 인프라 경제의 방향성을 제시했습니다. 컴퓨팅 자원의 상당 부분이 추론에 사용되며, 시스템 규모가 커지면서 처리량과 안정적인 오케스트레이션이 중요해지고 있습니다. 또한, 워크로드 전문화와 효율적인 비용 절감 기술이 핵심 경쟁력이 될 것이라고 전망합니다.
핵심 포인트
- AI 인프라 자원의 50%가 추론(inference)에 사용되고 있다.
- 시스템 규모에서는 가동 시간보다 처리량과 완료된 작업량이 중요하다.
- 구형 GPU는 워크로드 전문화를 통해 디코드 및 소규모 모델 추론에 활용 가능하다.
- 효율적인 오케스트레이션은 토큰당 비용 절감의 핵심 요소다.
CoreWeave CTO Peter Salanki는 AI 인프라 경제가 어디로 향하고 있는지에 대해 다음과 같이 언급했습니다:
CoreWeave 컴퓨팅 자원의 약 50%는 이미 추론(inference)에 사용되고 있습니다. 추론, 강화학습 (reinforcement learning), 분산 키-값 캐싱은 점차 트레이닝급 네트워킹을 필요로 합니다.
10만 GPU의 Grace Blackwell 클러스터는 약 250 MW를 소비하며 약 16M개의 연결 지점을 가집니다. 이러한 규모에서는 장애가 불가피합니다. 헤드라인 상의 가동 시간(uptime)보다 좋은 처리량(goodput)과 완료된 작업량이 더 중요합니다.
실패, 재시도 또는 미흡한 오케스트레이션으로 인해 사이클을 10%만 손실해도 유효 토큰 비용은 약 10% 상승합니다. 토큰당 비용은 칩 벤치마크가 아니라 전체 시스템의 산출물입니다.
구형 GPU는 워크로드 전문화를 통해 가치를 유지할 수 있습니다: 최신 칩은 프리필(prefill) 및 프론티어 컴퓨팅에, 구형 GPU는 디코드(decode), 평가(evaluations) 및 소규모 모델 추론에 사용됩니다.
Vera Rubin은 추론 비용을 최대 90%까지 절감하고, 첫 토큰 생성 시간(time to first token)을 개선하며, 밀도를 높일 수 있습니다.
Salanki는
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: Benchmark의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기