
2026년의 LLM Gateways: OpenRouter, LiteLLM, Portkey 및 Cloudflare 비교
요약
LLM 게이트웨이의 역할과 주요 서비스인 OpenRouter, LiteLLM, Portkey, Cloudflare를 비교 분석합니다. 모델 API 앞단의 프록시가 프로덕션 인프라로서 갖는 중요성과 핵심 기능을 다룹니다.
핵심 포인트
- LLM 게이트웨이는 모델 전환, 폴백, 캐싱, 비용 관리 등을 처리하는 프록시 역할을 수행함
- OpenRouter는 400개 이상의 모델을 지원하며 월간 200조 개 이상의 토큰을 라우팅함
- 게이트웨이 도입을 통해 API 장애 대응 및 중앙 집중식 자격 증명 관리가 가능함
- 최근 Portkey 인수 등 LLM 인프라 시장의 급격한 변화가 관찰됨
OpenRouter의 자체 수치에 따르면, 70개 이상의 제공업체로부터 제공되는 400개 이상의 모델을 통해 월간 200조 개 이상의 토큰이 1,000만 명 이상의 사용자에게 라우팅되고 있습니다. 모델 API 앞단의 프록시(Proxy)는 더 이상 단순한 편의 도구가 아니라 프로덕션 인프라(Production infrastructure)가 되었습니다. 동시에, 이러한 프록시를 구축하는 기업들에게 2026년은 매우 혹독한 해였습니다. Palo Alto Networks가 5월에 Portkey를 인수했고, Mintlify는 3월에 Helicone을 흡수하여 동결했으며, Martian은 해석 가능성(Interpretability) 연구로 피벗(Pivot)했고, Not Diamond는 코딩 에이전트 전용 라우팅으로 사업 범위를 축소했습니다.
이 글은 제가 DevToolLab에 게시한 더 긴 가이드인 Best LLM Gateways and API Routers in 2026의 요약 버전이며, 해당 가이드에는 전체 가격 분석과 더 많은 코드가 포함되어 있습니다.
게이트웨이가 실제로 하는 일
LLM 게이트웨이(AI 게이트웨이 또는 API 라우터와 동일한 개념)는 여러분의 앱과 제공업체 사이의 프록시입니다. 여러분의 코드는 api.openai.com 대신 게이트웨이를 호출하며, 게이트웨이는 모델 호출과 관련된 모든 것을 처리합니다:
- 모든 제공업체에 대해 하나의 OpenAI 호환 형식을 제공하므로, 모델을 전환할 때 코드를 다시 작성할 필요 없이 설정만 변경하면 됩니다.
- 제공업체에 장애가 발생하거나 속도 제한(Rate-limits)이 걸릴 때 자동 폴백(Fallback) 및 재시도(Retries)를 수행합니다.
- 중앙 집중식 자격 증명(Credentials): 서비스는 범위가 지정된 가상 키(Virtual keys)를 할당받고, 게이트웨이가 실제 키를 보유합니다.
- 캐싱(Caching) (정확한 캐싱 또는 의미론적 캐싱): 중복된 프롬프트가 비용을 두 번 발생시키지 않도록 합니다.
- 예산, 속도 제한(Rate limits) 및 팀별 비용 귀속.
이는 모델 API에 적용된 로드 밸런서(Load balancer) 논리와 같습니다. 팀들이 게이트웨이를 도입하게 만드는 고통은 항상 구체적입니다. 예를 들어, 12개의 서비스가 gpt-4o를 직접 호출하다가 OpenAI 장애 발생 시 한꺼번에 타임아웃이 발생하거나, 가상 키 시스템이 없어 프로덕션용 Anthropic 키가 세 개의 리포지토리(Repo)에 붙여넣어지는 상황 같은 것들입니다.
네 가지 주요 옵션
| 게이트웨이 | 유형 | 셀프 호스팅 (Self-hosted) | 눈에 띄는 비용 관련 사실 |
|---|---|---|---|
| OpenRouter | 호스팅된 프록시 (Hosted proxy) | 아니요 | 토큰 마진 없음; 카드 충전 시 5.5% 수수료 (최소 $0.80) |
| ... |
OpenRouter

OpenRouter는 가장 폭넓은 카탈로그를 원하면서 인프라 관리가 전혀 필요 없는 경우에 대한 기본 해답입니다. 토큰당 가격에 대한 마진(markup)은 없으며, 비즈니스는 5.5%의 크레딧 충전 수수료(최소 $0.80), 암호화폐 결제 시 5%, 그리고 월 첫 100만 건의 무료 요청을 초과하는 BYOK(Bring-Your-Own-Key, 직접 키 사용) 트래픽에 대한 5% 수수료로 운영됩니다. OpenRouter는 2026년 5월 CapitalG가 주도하고 Nvidia의 NVentures가 참여한 1억 1,300만 달러 규모의 Series B 투자를 유치했으며, 기업 가치는 약 13억 달러로 평가받고 있어 조만간 사라질 서비스가 아닙니다.
통합 방법은 공식 OpenAI SDK에서 Base URL을 교체하고 provider/model 슬러그(slug)를 사용하는 방식입니다:
from openai import OpenAI
client = OpenAI(
...
트레이드오프(Tradeoff): 사용자와 모든 모델 호출 사이에 위치하는 폐쇄 소스(closed-source) 호스팅 프록시(hosted proxy)라는 점입니다.
LiteLLM

LiteLLM은 정반대의 선택지입니다. 완전한 오픈 소스(GitHub 스타 약 55,000개, YC W23 기업인 BerriAI가 구축)이며, 100개 이상의 제공업체(provider)를 사용자가 직접 실행하는 OpenAI 호환 인터페이스 뒤로 통합합니다. Python SDK로 사용하거나, 더 일반적으로는 팀 전체가 가리키는 독립형 프록시(standalone proxy)로 사용하여 Go 및 Node 서비스에도 동일한 통합 HTTP 인터페이스를 제공할 수 있습니다. config.yaml을 통해 친숙한 모델 이름을 실제 배포 모델에 매핑하며, litellm --config config.yaml 명령어를 통해 프록시를 4000번 포트에서 실행합니다.
직접 호스팅(self-host)할 경우 절대 간과해서는 안 될 사항이 있습니다: LiteLLM의 MCP 테스트 엔드포인트에서 발견된 CVSS 8.7 점수의 커맨드 인젝션 (command-injection) 취약점인 CVE-2026-42271입니다. 이는 버전 1.74.2부터 1.83.6까지 영향을 미쳤습니다. Starlette 호스트 헤더 우회 (host-header bypass, CVE-2026-48710)와 결합되어 인증되지 않은 원격 코드 실행 (remote code execution)으로 이어졌으며, 실제 공격 사례가 관찰되어 CISA의 알려진 취약점 (Known Exploited Vulnerabilities) 카탈로그에 등재되었습니다. 1.83.7 버전에서 수정되었습니다. 즉시 패치하고 관리자 및 테스트 엔드포인트를 공용 인터넷에 노출하지 마십시오.
엔터프라이즈 가격 책정 (SSO, RBAC, 감사 로그)은 공개되지 않으며 개별 계약을 통해 협의됩니다.
Portkey
Portkey는 빠른 오픈소스 (open-source) 게이트웨이 (~12,500 stars, 1,600개 이상의 모델, 50개 이상의 내장 가드레일)와 호스팅되는 관측성 (observability) 레이어(시맨틱 캐싱 (semantic caching), 로드 밸런싱 (load balancing), 가상 키 (virtual keys), 콘텐츠 가드레일)를 결합합니다. OSS 게이트웨이를 직접 호스팅하는 것은 로그 제한 없이 무료입니다. 호스팅되는 단계별 요금제는 1만 개의 로그를 제공하는 무료 개발자 (Developer) 티어 (3일 보관, 명시적으로 프로덕션용 아님)부터, 월 49달러에 10만 개의 로그를 제공하는 프로덕션 (Production) 티어, 그리고 규정 준수가 중요한 배포를 위한 엔터프라이즈 (Enterprise) 티어까지 운영됩니다.
2026년의 주의 사항은 소유권 문제입니다. Palo Alto Networks는 2026년 5월 29일에 Portkey 인수를 완료했으며, Protect AI 및 CyberArk 인수와 더불어 AI 에이전트 보안의 일부로 포지셔닝했습니다. OSS 게이트웨이는 현재도 작동하지만, 아직 공개적인 로드맵 약속은 없으므로 이에 대한 다년 단위의 베팅은 모니터링이 필요한 사항으로 간주하십시오.
Cloudflare AI Gateway
[
이미 Cloudflare를 사용 중이라면, 이것은 5분 만에 끝낼 수 있는 옵션입니다. 모든 플랜에서 무료로 제공되며 Workers AI, OpenAI, Anthropic, Gemini 및 Replicate 전반에 걸쳐 분석(analytics), 로깅(logging), 캐싱(caching), 속도 제한(rate limiting) 및 폴백(fallback) 기능을 지원합니다. 유료 추가 기능으로는 Logpush(월 1,000만 건 초과 시 100만 레코드당 $0.05, Workers Paid 플랜 필요)와 새로운 통합 결제(Unified Billing)가 있으며, 통합 결제는 5%의 수수료로 제3자 모델 사용 비용을 Cloudflare 청구서에 포함시켜 줍니다. 이 서비스는 의도적으로 기능이 가장 밀집된 게이트웨이로 설계되지 않았습니다. 대신, 이미 Cloudflare를 사용하고 있기 때문에 바로 활성화할 수 있는 도구입니다.
엔터프라이즈 분야의 주목할 만한 솔루션 (Enterprise honorable mentions)
Kong AI Gateway는 시맨틱 캐싱(semantic caching), 프롬프트 압축(prompt compression), 개인정보(PII) 정화 및 MCP/에이전트 트래픽 거버넌스(governance) 기능을 통해 기존의 Kong API 관리 배포 환경을 확장합니다. 이는 주로 Kong이 이미 귀사의 공식 게이트웨이인 경우에 유효합니다. TrueFoundry는 250개 이상의 모델, RBAC(역할 기반 액세스 제어), 예산 제어 및 온프레미스(on-prem) 배포를 제공하며 동일한 구매자를 타겟팅합니다. 가격은 무료 티어부터 월 $499의 Pro, 월 $2,999의 Pro Plus까지 다양하며, Peak XV와 Intel Capital 라운드를 통해 약 2,100만 달러를 유치했습니다.
2026년의 통합이 여러분의 선택에 의미하는 바
네 개의 라우팅 스타트업이 약 5개월 사이에 정체성이 변했습니다: Portkey(인수됨), Helicone(~16,000개 조직을 위해 14조 개 이상의 토큰을 처리한 후 인수되어 유지 관리 모드로 전환됨), Martian(현재 해석 가능성(interpretability) 연구 기업), 그리고 Not Diamond(코딩 에이전트 라우팅으로 범위를 좁힘)입니다. 이 카테고리가 사라지는 것은 아닙니다. 다만 플랫폼들이 이 분야를 소유하고 싶어 할 만큼 충분히 빠르게 성숙했으며, 순수 라우팅만으로는 방어 가능한 독립 비즈니스가 되기 어렵다는 것이 밝혀졌을 뿐입니다.
실질적인 필터링 기준: 포크(fork)하여 자체 호스팅할 수 있는 것(LiteLLM, Portkey의 OSS 게이트웨이) 또는 지속적으로 자금을 지원할 명확한 이유가 있는 플랫폼에서 호스팅하는 것(OpenRouter, Cloudflare)을 선택하십시오. 다음 분기에 로드맵이 바뀔 수 있는 규모가 작은 독립 기업들은 주의해야 합니다.
최소한의 초기 설정
계정 생성 없이 가장 빠르게 진행할 수 있는 방법은 LiteLLM입니다: pip install litellm[proxy]를 실행하고, 제공업체(provider) 키를 환경 변수(environment variables)로 내보낸 뒤, 사용할 모델들을 나열한 config.yaml을 작성합니다. 그 다음 프록시(proxy)를 시작하고, 기존 OpenAI 클라이언트의 base_url만 http://localhost:4000으로 변경하면 됩니다. 그다음 모델별로 fallbacks 리스트를 추가하여, 제공업체 장애 시 사용자에게 에러가 발생하는 대신 서비스가 점진적으로 저하(degrade gracefully)되도록 설정하십시오. 원본 가이드에서는 정확한 설정 코드 스니펫(config snippets)과 함께 이 7가지 단계를 모두 설명합니다.
무엇인가를 라우팅(route)하기 전에, DevToolLab의 AI Token Counter를 통해 GPT-5, Claude, Gemini, Llama의 토큰 사용량과 비용을 추정해 볼 수 있으며, cURL to Code Converter를 사용하면 게이트웨이 cURL 예제를 fetch, Axios 또는 Python 코드로 변환할 수 있습니다.
권장 사항
- 가장 폭넓은 카탈로그, 호스팅이 필요 없는 경우: OpenRouter.
- 완전한 제어권, 셀프 호스팅(self-hosted): LiteLLM (CVE 이력을 고려하여 패치를 최신 상태로 유지하십시오).
- 가드레일(Guardrails)과 팀별 관측성(observability)이 우선인 경우: Portkey (Palo Alto의 로드맵을 주시하십시오).
- 이미 Workers를 사용 중인 경우: Cloudflare AI Gateway는 거의 공짜 점심에 가깝습니다.
수십 개의 서비스에서 모델 API를 직접 호출하는 방식은 두 번째 제공업체 장애를 견뎌낼 수 없었을 것입니다. 2026년에 게이트웨이는 있으면 좋은 기능(nice-to-have)이 아니라 표준 인프라입니다.
참고 문헌
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기