LangSmith LLM Gateway: 에이전트를 위한 런타임 제어 기능
요약
LangSmith LLM Gateway는 에이전트가 호출하는 모델과 사이에 위치하여 중앙 집중식 거버넌스 레이어를 제공합니다. 이를 통해 비용 초과 방지, 속도 제한, 모델 폴백 구성 등 운영 환경에서 필요한 런타임 제어를 일관되게 적용할 수 있습니다. 또한 PII 같은 민감 데이터 마스킹을 지원하여 보안성을 높입니다.
핵심 포인트
- 중앙 게이트웨이를 통해 공급자 종속성(provider lock-in)을 회피합니다.
- 지출 상한, 속도 제한 등 런타임 제어를 한 곳에서 일관되게 적용할 수 있습니다.
- PII 같은 민감 데이터는 모델 호출 전에 마스킹하여 보안성을 확보합니다.
- 조직/작업 공간/API 키/사용자 레벨별로 지출을 세밀하게 통제 가능합니다.
핵심 요약
공급자 종속성(provider lock-in) 회피 — 폐쇄형 및 오픈 가중치 모델을 위한 단일 게이트웨이를 통해 중앙 집중식 제어를 구현하고, 모델 공급자를 변경할 수 있는 유연성을 확보합니다.
런타임에서 비용 및 신뢰성 제어 — 지출 한도와 속도 제한을 설정하고, 사용량을 추적하며, 모든 모델, 공급자 또는 호스트에 걸쳐 모델 폴백(model fallbacks)을 구성할 수 있습니다.
마스킹을 통한 민감 데이터 보호 — PII(개인 식별 정보) 및 비밀 정보 같은 민감 데이터를 모델 호출에서 마스킹하여, 해당 데이터가 모델 공급자로 전송되는 것을 방지합니다.
LangSmith LLM Gateway가 현재 public beta로 제공됩니다.
운영 환경의 에이전트는 비용 초과나 서비스 중단 같은 원치 않는 결과를 피하기 위해 모델 호출에 대한 런타임 제어가 필요합니다. 지출 상한(Spend caps), 속도 제한(rate limits), 모델 폴백, 민감 데이터 보호는 모두 중요한 제어 기능이지만, 적절한 도구가 없으면 엔지니어들은 특정 모델 공급자에 대해 각 에이전트 내부에 이러한 제어를 수동으로 작성해야 합니다.
그래서 저희가 LangSmith LLM Gateway를 구축했습니다. 이는 에이전트와 에이전트가 호출하는 모델 사이에 위치하는 중앙 거버넌스 레이어(central governance layer)이며, 운영 환경에서 에이전트 엔지니어링 팀이 필요로 하는 제어를 위해 특별히 설계되었습니다. LLM Gateway는 팀들이 에이전트, 모델, 공급자 전반에 걸쳐 런타임 제어를 한 곳에서 적용할 수 있게 하여, 벤더 종속성을 피하면서도 일관되게 모델 사용을 관리하도록 돕습니다.

중앙 집중식 거버넌스 레이어가 에이전트에게 필요한 이유
운영 환경에서 모델 계층은 비용이 많이 드는 실수나 고객에게 노출되는 서비스 중단 지점의 원인이 될 수 있습니다. 실제 사례를 들어보겠습니다: 사용하고 있는 모델 공급자가 장애를 겪어, 이제 고객 서비스 에이전트가 오류를 반환하게 되고, 이는 고객 불만과 매출 손실로 이어집니다. 또는 코딩 에이전트가 밤새 재시도 루프(retry loop)에 빠져서, 아침에는 10,000개의 LLM 호출을 수행했고 네 자리 숫자의 청구서를 받게 됩니다.
이러한 경우, 사후에 무슨 일이 일어났는지 이해하는 것만으로는 충분하지 않습니다. 위반이 발생하기 전에 정책을 강제해야 합니다. 하지만 제어가 각 에이전트의 코드에 내장되어 있다면, 새로운 에이전트와 모델 제공업체가 추가적인 구현 경로를 유지하게 만듭니다. 모델 게이트웨이는 팀이 한 번 정책을 정의한 다음, 이를 모델과 에이전트 전반에 걸쳐 일관되게 강제할 수 있도록 합니다.
LLM Gateway 제어 기능
LLM Gateway는 에이전트가 프로덕션 환경으로 나갈 때 팀이 필요로 하는 제어 기능을 제공합니다: 비용 제어, 속도 제한(rate limits), 모델 폴백(model fallbacks), 민감 데이터 처리 등입니다.
비용 초과 방지: LLM Gateway를 사용하면 내부 및 외부 사용자들을 위한 LLM 지출을 문제가 되기 전에 모니터링하고 제어할 수 있습니다. 시간 제한 상한액을 설정하고 네 가지 레벨에서 지출을 추적할 수 있습니다:
조직(Organization) 레벨— 회사 전체의 제어를 위해
작업 공간(Workspace) 레벨— 팀이 지출 한도 내에 있도록 유지하기 위해
API 키 레벨— 특정 프로젝트의 지출을 제어하는 데 유용함
사용자(User) 레벨— 개별 지출 제어를 위해
상한액에 도달하면 에이전트는 명확한 오류와 함께 402 응답을 받습니다.

통제 불능 트래픽 제한: 조직, 작업 공간, 사용자 및 API 키 레벨에서 속도 제한을 적용하여 우발적인 오용이나 트래픽 급증으로 인해 제공업체 한계를 압도하고 다른 에이전트나 팀의 신뢰도를 저하시키는 것을 방지합니다.
지출 및 속도 제한에 대한 고객별 정책: 다중 테넌트(multi-tenant) 환경과 리셀러를 위해, LLM Gateway는 고객별 API 키 없이도 고객 레벨의 제어를 제공합니다. 사용자 지정 요청 헤더(custom request header)를 사용하여 각 최종 고객이나 팀을 식별한 다음, 모든 LLM 호출을 하나의 API 키로 라우팅하는 동시에 별도의 지출 상한액과 속도 제한을 강제할 수 있습니다. 직접 로직을 구축하고 유지 관리하는 대신, 한 곳에서 여러 고객에 걸친 한도를 업데이트하고 지출을 확인할 수 있습니다.
에이전트 신뢰성 향상: 모델과 호스트 전반에 걸쳐 폴백(fallback) 규칙을 정의하고 모든 애플리케이션에 강제할 수 있습니다. 제공업체가 다운되거나, 속도 제한(rate-limited)되거나, 사용 불가능할 때, 에이전트는 각 애플리케이션마다 맞춤형 폴백 로직 없이 다른 모델로 라우팅될 수 있습니다.
민감 데이터 노출 감소: 요청이 모델 제공업체에 도달하기 전에 개인 식별 정보(PII)와 비밀 정보를 감지하고, 수정하며, 대체합니다. LLM Gateway는 LangSmith에 기록하는 트레이스에서도 민감 데이터를 수정합니다. 현재 이 기능은 Enterprise 플랜 사용자에게만 제공됩니다.
LangSmith에서 LLM Gateway 이벤트 추적: 게이트웨이 이벤트는 LangSmith 트레이스의 메타데이터로 기록되므로, 프로덕션 트래픽으로 제어 장치가 어떻게 작동하는지 모니터링할 수 있습니다. 지출 한도, 속도 제한 또는 기타 제어에 의해 요청이 차단될 때, 트레이스를 열어 컨텍스트에서 무슨 일이 일어났는지 검사하고 변경해야 할 것이 있는지 결정할 수 있습니다.
모델 선택 유지하기
LLM Gateway는 에이전트와 모델 제공업체 간의 호출 라우팅을 위한 단일 인터페이스를 제공합니다. OpenAI, Anthropic, Fireworks와 같은 인기 있는 제공업체와 OpenAI 또는 Anthropic과 호환되는 엔드포인트를 가진 사용자 정의 모델을 지원합니다.
LangSmith Gateway는 BYOK(Bring Your Own Key) 우선입니다. 자체 제공업체 키를 가져와서 모든 LLM 호출에 추가적인 계측(instrumentation)을 추가하지 않고도 라우팅, 거버넌스 및 정책 제어에 LLM Gateway를 사용할 수 있습니다. 더 간단한 조달이나 에이전트 구축의 빠른 방법을 원하는 팀을 위해, 게이트웨이는 또한 Fireworks가 구동하는 오픈 모델의 호스팅 추론(hosted inference)도 지원하며, 이는 LangSmith에서 게이트웨이 크레딧을 사용하여 직접 이용할 수 있습니다. Fireworks는 오픈 모델에 빠르고 효율적인 추론을 제공하여, 팀들이 이를 LangSmith LLM Gateway를 통해 프로덕션으로 가져오는 데 도움을 줍니다.

저희는 오픈 웨이트 모델이 팀들에게 AI 시스템에 대한 더 많은 통제권을 제공하기 때문에 중요하다고 믿습니다. 이는 비용, 품질, 지연 시간(latency), 개인 정보 보호 및 배포 요구 사항 측면에서 최적화할 수 있는 유연성을 제공하며, 기업의 특정 상황에 맞춰 모델을 조정할 수 있게 합니다. Gateway는 저희가 오픈 모델을 프로덕션 환경에서 채택하기 쉽게 만드는 방법 중 하나입니다.
오픈 모델은 이미 팀들이 프로덕션 AI를 위해 필요로 하는 성능을 제공하고 있습니다. 다음 단계는 비용, 지연 시간 및 거버넌스(governance)에 대한 통제가 필요한 에이전트 워크플로우에서 이를 더 쉽게 채택할 수 있도록 만드는 것입니다. Fireworks는 오픈 모델 추론을 대규모로 빠르고 효율적이며 안정적으로 구현하며, 저희는 팀들이 이러한 성능을 프로덕션으로 가져오는 데 도움을 주기 위해 LangChain과 LangSmith LLM Gateway를 협력하게 되어 기쁩니다.
Lin Qiao, CEO, Fireworks
팀들이 프로덕션에서 LLM Gateway를 사용하는 방법
팀들은 이미 프로덕션 에이전트 주변에 엄격한 제한 및 공유 제어를 적용하기 위해 LLM Gateway를 사용하고 있습니다. 일반적인 패턴에는 지출 상한선(spend caps)이 필요한 대외 서비스용 에이전트와 중앙 집중식 청구, 사용량 추적 및 고객별 제한이 필요한 다중 고객용 에이전트가 포함됩니다.
LLM Gateway 덕분에 저희는 Deep Agents의 청구 및 비용 추적을 중앙 집중화하여 각 고객에 대한 사용량과 제한 사항 가시성을 확보할 수 있었습니다. 통합은 간단했으며, 에이전트를 확장하는 데 필요한 관측 가능성(observability)을 제공합니다. Sean Rich, Cofounder and CTO, Blueberry AI
모든 프로덕션 에이전트는 특히 대외 서비스용 에이전트의 경우 엄격한 지출 상한선이 필요하며, LLM Gateway는 설정된 한도를 초과하는 비용이 절대 발생하지 않도록 하여 이러한 위험을 제거합니다. 이제 고객과 앉아 지출 및 지원되는 기타 정책에 대해 합의하고 몇 번의 클릭만으로 모든 것을 구성할 수 있습니다. Hylke Sybesma, AI Engineer, Friday Digital Agency
LLM Gateway 시작하기
LLM Gateway를 API를 통해 직접 호출하거나 Claude Code, Codex, Deep Agents Code(dcode)와 같은 코딩 하네스(coding harnesses)와 함께 사용할 수 있습니다.
시작하려면 에이전트를 LangSmith Gateway 엔드포인트로 지정하고, LangSmith API 키로 인증한 다음, 제공업체(provider) API 키를 워크스페이스 시크릿에 추가하세요. 그런 다음 폴백(fallbacks), 속도 제한(rate limits), 지출 한도(spend limits), 민감 데이터 처리 등에 대한 제어를 구성합니다. base_url을 업데이트하고 나머지 코드는 그대로 유지하면 됩니다.
LLM Gateway의 향후 계획
저희는 팀들이 가장 필요로 하는 제어 기능들로 LLM Gateway를 시작했습니다. 다음으로는 프로덕션 환경에서 모델 호출을 관리할 수 있는 더 많은 방법을 통해 이 기반을 확장할 예정입니다.
더 광범위한 가드레일(Broader guardrails) — 에이전트가 외부 모델을 호출하고 프로덕션 시스템과 상호 작용하면서 발생하는 위험에 대한 커버리지를 확대합니다.CI/CD 제어(CI/CD controls) — 프롬프트와 컨텍스트를 배포하고, A/B 테스트를 실행하며, 블루-그린 및 섀도우 배포를 관리하고, 인프라스트럭처-애즈-코드(Infrastructure-as-Code)로 제어를 정의하기 위한 도구입니다.
오늘 바로 사용해 보세요
LLM Gateway는 Plus 및 Enterprise 플랜에서 현재 퍼블릭 베타로 이용 가능합니다.
LangSmith에 로그인하거나 가입하여 시작한 다음, 사이드바에서 “LLM Gateway”를 선택하세요. 설정 세부 정보는 문서(docs)에서 확인할 수 있습니다.
Enterprise 플랜 사용자는 여기서 데이터 보호 제어(Data Protection controls) 접근을 요청할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 LangChain Blog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기