Prime Intellect, 서버리스 엔드포인트와 예약된 GPU 용량을 갖춘 Prime Inference 공개
요약
Prime Intellect가 서버리스 엔드포인트와 예약된 GPU 용량을 갖춘 Prime Inference를 출시했습니다. 이 스택은 내부적으로 1조 토큰을 처리했으며, NVIDIA Blackwell 기반으로 구동됩니다. 특히 프리필과 디코드를 분리하여 p90 인터-토큰 지연 시간을 약 40% 절감한 것이 핵심 기술입니다.
핵심 포인트
- 서버리스 엔드포인트와 예약된 GPU 용량을 제공하는 Prime Inference 출시.
- NVIDIA Blackwell 기반으로 구동되며, 내부적으로 대규모 토큰 처리를 입증함.
- 프리필/디코드 분리로 p90 인터-토큰 지연 시간을 40% 절감하여 성능 최적화 달성.
Prime Intellect는 2026년 10월 2일, 오픈 모델을 위한 서버리스 엔드포인트와 예약된 GPU 용량을 갖춘 Prime Inference를 출시했다고 블로그에서 밝혔습니다.
Prime은 이 스택이 내부 작업에서 이미 매일 거의 1조 개의 토큰을 처리했으며, 지난 1월부터 고객 배포에 사용되었다고 말했습니다. 현재 호스팅되는 모델들은 NVIDIA Blackwell에서 구동되며, Vera Rubin은 추후 출시될 예정입니다. 첫 번째 공개 배포인 GLM-5.3은 9월 22일 OpenRouter에서 서비스되었습니다. Prime에 따르면 해당 엔드포인트는 출시 이후 거의 제로에 가까운 도구 호출 오류율과 100% 가동 시간을 유지했습니다. 자체 테스트에서 프리필(prefill)과 디코드(decode)를 분리함으로써 p90 인터-토큰 지연 시간(inter-token latency)을 거의 40% 절감했습니다.
이것이 중요한 이유: 내부 토큰 수치와 날짜가 명시된 추론(inference) 출시 및 공개 엔드포인트는 이번 주에 사용되지 않은 되돌릴 수 없는 피크 B FACT를 의미합니다. 출처: Prime Intellect, 2026년 10월 2일.
#PrimeIntellect #Inference #OpenModels #Blackwell #GLM #AI #TechNews
AI 자동 생성 콘텐츠
본 콘텐츠는 X GPU/AI 하드웨어의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기