llm-router: Claude Pro/Max 할당량 절약 방법
요약
llm-router는 코딩 도구의 라이프사이클에 연결되어 사용자가 제출하는 모든 프롬프트를 가로채(intercept) 모델이 처리하기 전에 먼저 무료 또는 로컬 모델로 초안을 작성합니다. 이를 통해 Claude Pro/Max와 같은 유료 구독 서비스의 할당량 낭비를 막고 비용 효율성을 높일 수 있습니다. API 키 없이도 작동하며, 다양한 코딩 도구에 설치할 수 있는 것이 특징입니다.
핵심 포인트
- Claude Pro/Max 사용 시 할당량 절약에 효과적이다.
- 프롬프트가 모델에 전달되기 전 무료/로컬 모델로 초안을 작성한다.
- API 키 없이도 작동하며, 다양한 코딩 도구(VS Code, Cursor 등)를 지원한다.
- 라우팅된 답변은 기본적으로 자문용이며, 설정을 통해 동작 방식을 제어할 수 있다.
Claude Pro/Max 할당량을 무료 모델로 답변 가능한 질문에 낭비하는 것을 멈추세요.
llm-router는 사용 중인 코딩 도구의 라이프사이클에 연결되어, 모델이 처리하기 전에 각 프롬프트를 읽고 먼저 무료 또는 로컬 모델로 초안을 작성합니다. Claude 구독 시 API 키가 필요하지 않으며 — 라우팅은 MCP 도구와 로컬 모델을 통해 실행됩니다.
한 가지 주의사항: 라우팅된 답변은 기본적으로 자문용(advisory)입니다 — LLM_ROUTER_ZERO_CLAUDE=1이 아닌 경우 Claude가 여전히 턴을 가져갑니다.
기본적으로 일부 도구 호출은 프롬프트가 라우팅될 때까지 기다립니다. LLM_ROUTER_ENFORCE=off는 이를 비활성화합니다. 초안 작성률(Draft-rate)과 수용률(acceptance figures)은 docs/MEASUREMENT.md에 있으며, 그 n 값, 윈도우 및 조건이 명시되어 있습니다.
📑 목차
사용자가 Claude Pro 또는 Max 플랜을 사용하고 있고, 추가로 돈을 쓰지 않았음에도 불구하고 5시간 제한에 도달한 경우 — 이는 질문이 너무 많아서가 아니라 모든 프롬프트가 프리미엄 모델로 전송되었기 때문입니다:
Claude Pro/Max 구독 시 API 키가 필요 없습니다 — 라우팅은 MCP 도구와 로컬 모델을 통해 이루어집니다. 제공업체 키를 추가하면 풀이 넓어지지만, 아무것도 이를 요구하지는 않습니다. guide/PROVIDERS.md를 참조하세요. 다른 호스트에 설치하려면 Works With 섹션을 참고하세요.
| Host | Install |
|---|---|
| Claude Code (default) | llm-router install |
| Codex CLI | llm-router install --host codex |
| OpenCode | llm-router install --host opencode |
| Gemini CLI | llm-router install --host gemini-cli |
| GitHub Copilot CLI | llm-router install --host copilot-cli |
| OpenClaw | llm-router install --host openclaw |
| Trae IDE | llm-router install --host trae |
| Pi (pi.dev) | llm-router install --host pi |
| Factory Droid | llm-router install --host factory |
| Claude Desktop | llm-router install --host desktop |
| VS Code (native MCP) | llm-router install --host vscode |
| Cursor | llm-router install --host cursor |
| GitHub Copilot in VS Code (capability extension, no cost-routing) | llm-router install --host copilot |
| Windsurf / Cascade | llm-router install --host windsurf |
| Kimi Code (Moonshot AI) | llm-router install --host kimi |
llm-router install --host all
이 명령어는 모든 호스트 설정을 한 번에 설치하거나 출력합니다. 각 호스트가 실제로 할 수 없는 내용까지 포함한 전체 호스트별 상세 정보는 guide/HOST_SUPPORT_MATRIX.md를 참고하세요.
Hooks는 코딩 도구 자체의 모델이 프롬프트를 보기 전에 가로챕니다(intercept). 무료 정규표현식 휴리스틱(regex heuristic)이 이를 즉시 분류하며, 실제 프롬프트 중 약 절반에 대해 신뢰도를 점수화합니다 — 1,571개 중 788개 측정 (scripts/measure_low_signal_rate.py를 2026-09-23에 실행); 나머지는 기본값으로 폴백(fallback)됩니다. 라우팅 가능한 프롬프트는 먼저 무료/로컬 모델로부터 초안을 받아낸 다음, 필요한 경우에만 유료 모델 쪽으로 순차적으로 이동합니다.
이 초안은 권고용입니다 — LLM_ROUTER_ZERO_CLAUDE=1이 설정되지 않는 한, 검증되지 않은 힌트로서 Claude에게 전달될 뿐, 턴(turn) 대체물로 사용되지는 않습니다. 강제 적용은 도구 호출(tool-call) 수준에서 이루어집니다: smart(기본값)는 프롬프트가 라우팅될 때까지 선택된 도구 호출을 보류하고; off는...
disables that. 전체 모드 및 호스트별 재정의(per-host overrides):
guide/GETTING_STARTED.md.
비밀 정보는 절대 기기를 벗어나지 않습니다. API 키, 토큰 또는 개인 키가 포함된 프롬프트는 로컬 모델로만 라우팅되며 — 실패 시 닫힘(fail-closed) 방식으로 작동합니다.회로 차단기(circuit breakers)를 이용한 자동 폴백(Automatic fallback). 장애가 발생하거나 속도 제한이 걸린 제공업체는 재시도되지 않고 건너뜁니다.작동하는 것을 볼 수 있습니다. 상태 표시줄, 터미널 제목 및 OS 알림에 마지막으로 라우팅된 모델, 절약액 및 상태가 표시됩니다.세션 종료 요약. 기준선 대비 절약액, 계층 혼합(tier mix), 제공업체별 비용, 지연 시간 p50/p95/p99 및 상위 경로를 보여줍니다.미디어와 파이프라인도 가능합니다.llm_image
/llm_video
/llm_audio
, 그리고 다단계 연구를 위한 llm_orchestrate.
기본 MCP 표면은 **12개의 프론트 도어 도구(front-door tools)**를 보여주며; LLM_ROUTER_SLIM=off는 등록된 모든 것을 보여줍니다.
| 주제 | 내용 | 가이드 |
|---|---|---|
| CLI | install, status, gain, doctor, okf index/status, sessions status 및 기타 | guide/GETTING_STARTED.md |
| 제공업체(Providers) | 무료 우선 — Ollama (로컬), OpenRouter, Gemini, Groq, 사용자의 Claude 구독 | guide/PROVIDERS.md |
| 라우팅 정책(Routing Policies) | conservative → balanced (기본값) → cost_aggressive; 임계값 및 YAML 스키마 | guide/POLICIES.md |
| MCP 도구 | 서명(signature)이 있는 모든 도구 | guide/TOOLS.md |
llm-router gain today # 오늘까지의 절약액
llm-router okf status # 지식 기반 최신성
llm-router sessions status # 세션별 요약
절약액 수치는 *반사실적(counterfactual)*입니다. 즉, 실제로 지출한 금액 대비 동일한 토큰이 API 리스트 가격으로 얼마였는지를 나타내는 것이며, 평면적인 구독료를 아낀 돈을 의미하지 않습니다. llm-router status와 llm-router savings-report는 검증된(verified) 절약액과 미검증된(unverified) 절약액으로 분리되며, 각각 고유의 n을 가집니다. 방법론, 가정 및 제한 사항: docs/MEASUREMENT.md.
llm-router는 전적으로 사용자의 기기에서 실행됩니다 — 호스팅되는 프록시가 없고, llm-router 서비스로 보내지는 것이 없으며, 계정이 필요하지 않습니다. 접지 확인(grounding check) (src/llm_router/grounding.py
) 컨텍스트와 인덱싱된 레포에 없는 파일을 또는 함수를 언급하는 초안은 모두 폐기되며, Claude로 넘어갑니다.
LLM_ROUTER_DIRECT_EXECUTION
이 기본값으로 설정되어 있습니다. 로컬 모델은 제한적이고 허용 목록(allowlisted)된 경로 하에서 write_file, edit_file, 그리고 run_command를 얻게 되며, 이 중 어느 것도 표적 삭제(git push --force)나 정보 유출을 막지는 못합니다. 이를 비활성화하려면 LLM_ROUTER_DIRECT_EXECUTION=false로 설정하세요. 전체 분석은 SECURITY.md에서 확인 가능합니다.
자체 감사(Self-audits) 결과는 **audit/**와 docs/repo_goals/AUDIT-2026-09-25.md(13개 충족, 6개 부분 충족, 1개 미충족)에 게시되며, 부정적인 결과도 포함됩니다.
Ground Truth 축적 (선택 사항, LLM_ROUTER_GROUND_TRUTH=1)
은 연결되지 않은 원격 측정(telemetry) 대신 재현 가능한 라우팅 결정의 코퍼스(corpus)를 구축합니다. 기본적으로 비활성화되어 있는데, 이는 프롬프트 텍스트를 디스크에 기록하는 유일한 부분이므로 그렇습니다. 자세한 내용은 guide/GROUND_TRUTH.md를 참고하세요.
전체 인덱스는 guide/README.md입니다.
| 문서 | 목적 |
|---|---|
| Quick Start (2분) | 작동하는 라우팅으로 가는 가장 빠른 경로 |
| ... | |
llm-router는 RouterArena 벤치마크에서 점수가 매겨집니다. 전체 분할(full split), 8,400개의 쿼리이며, 이 레포의 하네스(harness)를 사용하여 로컬에서 채점되며, 아직 독립적으로 검증되지 않았습니다. 현재 Arena 점수: 72.35입니다. 전체 방법론 및 부정적인 결과(튜닝을 4.25 포인트 오도한 프록시 분할 포함): docs/ROUTERARENA.md를 참고하세요. |
llm-router는 개별 개발자와 소규모 팀을 위해 구축되었습니다: 로컬 비용 절감, 운영 오버헤드 제로(zero ops overhead), 호스팅할 필요 없음. 팀 전체 정책 시행, 감사 내보내기(audit export), SSO 또는 조직별 예산에 대해서는 별도의 형제 제품인 Chuzom을 참조하세요.
기여를 환영합니다 — CONTRIBUTING.md를 참고하세요.
git clone https://github.com/ypollak2/llm-router.git
cd llm-router
uv sync --extra dev
...
MIT License. Issues · Discussions · PyPI · Changelog
AI 자동 생성 콘텐츠
본 콘텐츠는 GitHub AI Tools의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기