AI Gateway에서 서비스 티어(Service tiers) 사용 가능
요약
AI Gateway가 서비스 티어링 기능을 지원하여 사용 사례에 따라 지연 시간, 처리량, 비용을 최적화할 수 있게 되었습니다. OpenAI와 Gemini 모델을 지원하며, 워크로드 특성에 맞춰 티어를 선택하여 효율적인 API 관리가 가능합니다.
핵심 포인트
- 사용 사례별 지연 시간 및 비용 최적화 가능
- OpenAI 및 Gemini 모델 지원
- 다양한 AI API 형식(AI SDK, Anthropic Messages API 등) 호환
- 티어별 자동 과금 체계 적용
AI Gateway가 이제 서비스 티어링 (service tiering)을 지원합니다. 서비스 티어 (Service tiers)를 사용하면 사용 사례에 맞춰 지연 시간 (latency), 처리량 (throughput), 그리고 요청당 비용을 최적화할 수 있습니다. 대화형 워크로드(interactive workloads)에는 더 빠른 티어(대기열 감소, 더 높은 토큰 처리량)를 선택하거나, 더 높은 지연 시간을 허용할 수 있는 백그라운드 작업(background jobs)에는 더 낮은 비용의 티어를 선택하세요.
출시 시점에 서비스 티어링은 OpenAI 및 Gemini 모델에 대해 사용할 수 있습니다.
모든 AI Gateway API 형식에서 작동합니다: AI SDK, Chat Completions API, Anthropic Messages API, OpenAI Responses API, 그리고 OpenResponses API. AI Gateway는 각 요청이 사용한 티어에 따라 과금을 조정합니다. Service tiers AI SDK Chat Completions API Anthropic Messages API OpenAI Responses API OpenResponses API
서비스 티어가 지정되지 않은 경우, 요청은 기본 티어 (default tier)에서 실행됩니다.
providerOptions.gateway.serviceTier 아래에서 설정합니다. 동일한 옵션이 서비스 티어를 지원하는 모든 모델 및 제공업체(providers)에서 작동하므로, 제공업체별 옵션을 재구성하지 않고도 모델을 교체할 수 있습니다.
적용된 티어는 제공업체 메타데이터 (provider metadata)에 반환되므로, 어떤 티어가 요청을 처리했는지 확인할 수 있습니다. 이는 우선순위가 높은 요청이 기본 용량으로 전환되거나, 티어 간의 관찰된 지연 시간을 비교할 때 유용합니다.
서비스 티어는 최선 노력(best-effort) 기반으로 제공됩니다. 티어를 적용할 수 없는 경우 요청은 기본 속도로 기본 티어에서 실행되며, 오직 유효하지 않은 서비스 티어 값만이 요청을 실패하게 합니다.
모델이 여러 제공업체에 의해 서비스될 수 있고, 일부 제공업체에만 서비스 티어를 적용하거나 각 제공업체마다 다른 서비스 티어를 구성하려는 경우, 제공업체 자체 네임스페이스 (namespace)에 티어를 설정하세요.
AI Gateway는 각 요청이 실제로 사용한 티어에 따라 티어별 요율 (per-tier rates)을 자동으로 적용합니다. 만약 요청이 기본 용량 (default capacity)으로 다운그레이드되면, 요금 청구는 우선순위 요율 (priority rate)이 아닌 기본 요율 (default rate)을 반영합니다. priority
제공업체 및 티어링에 대한 자세한 내용은 서비스 티어 참조 (service tiers reference)에서 확인할 수 있습니다.
티어 (Tiers)
기본 사용법 (Basic usage)
가격 책정 (Pricing)
-
: 표준 처리
default -
: 비용이 증가하지만 더 빠른 처리
priority -
: 잠재적으로 지연 시간 (latency)은 높을 수 있으나 비용이 더 저렴함
flex
제공업체별 제어 (Per-provider control)
<table><tbody><tr><td><p><b>티어 (Tier)</b></p></td><td><p><code>default</code></p></td><td><p><code>priority</code></p></td><td><p><code>flex</code></p></td></tr><tr><td><p><b>기본 대비 비용 (Cost relative to default)</b></p></td><td><p>기준 (Baseline)</p></td><td><p>기본 가격의 약 1.8~2배</p></td><td><p>기본 가격의 약 0.5배</p></td></tr></tbody></table>AI 자동 생성 콘텐츠
본 콘텐츠는 Vercel AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기