Claude Code와 OpenRouter의 무료 모델 활용법: 비용 0원으로 AI 코딩 실현하는 5가지 설정
요약
본 글은 Claude Code의 백엔드를 OpenRouter의 무료 모델을 활용하여 비용 0원으로 운영하는 방법을 제시합니다. 환경 변수 설정과 모델 매핑, 폴백(fallback) 전략 등을 통해 Anthropic API 사용 시 발생하는 높은 비용 문제를 해결할 수 있습니다.
핵심 포인트
- OpenRouter를 이용해 Claude Code 백엔드를 비용 없이 전환 가능
- 무료 티어 모델을 활용하여 비용 절감 효과 극대화
- 모델명 매핑 및 폴백(fallback) 전략으로 안정성 확보
- 래퍼 스크립트를 통해 레이트 제한 문제를 해결하는 방법 제시
- OpenRouter의
:free
모델을 사용하면 Claude Code의 백엔드를 비용 0원으로 운영할 수 있습니다. 모델 선정, 레이트 제한 회피, 프롬프트 캐시 전략 세 가지 포인트를 잡으면 실용적인 수준에 도달합니다. - 2026년 기준으로 무료 할당량이 풍부한 모델들을 엄선하여 소개합니다.
Claude Code는 강력하지만, Anthropic API를 직접 사용하면 claude-3-5-sonnet-20241022로 입력 $3/MTok, 출력 $15/MTok이 발생합니다. 하루 200 커밋과 같은 헤비한 사용의 경우 월 수만 원 규모가 될 수 있습니다.
OpenRouter는 다양한 프로바이더의 모델들을 하나의 API 엔드포인트에 모아놓은 서비스로, 많은 모델에 :free 접미사가 붙은 무료 티어가 준비되어 있습니다. Claude Code는
ANTHROPIC_BASE_URL
과 ANTHROPIC_API_KEY
을 교체하는 것만으로 임의의 백엔드로 전환할 수 있기 때문에, 이 조합이 비용 절감책으로 주목받고 있습니다. OpenRouter에서는 각 모델에 대해 레이트 제한이 있는 무료 티어를 제공합니다. 2026년 5월 기준으로 대표적인 모델들은 다음과 같습니다 (모두 공식 문서에 기재된 공개 정보입니다):
| 모델 | 컨텍스트 | 무료 티어 제한 | 강점 영역 |
|---|---|---|---|
google/gemini-2.0-flash-exp:free | 1M tok | 10 req/min | 장문 코드 이해・일괄 리팩토링 |
qwen/qwen3-235b-a22b:free | 32K tok | 20 req/min | 다국어 코드 생성・중~대규모 태스크 |
meta-llama/llama-4-maverick:free | 128K tok | 10 req/min | 지시 추종・코드 리뷰 |
microsoft/mai-ds-r1:free | 163K tok | 5 req/min | 추론 체인・버그 분석 |
deepseek/deepseek-chat-v3-0324:free | 64K tok | 20 req/min | 일중영 코드・속도 우선 |
⚠️ 무료 티어는 프로바이더 측 상황에 따라 예고 없이 변경될 수 있습니다. 본번 중요 용도로는 유료 티어를 사용하십시오.
Claude Code는 환경 변수 ANTHROPIC_BASE_URL로 엔드포인트를 교체할 수 있습니다.
export ANTHROPIC_BASE_URL="https://openrouter.ai/api/v1"
export ANTHROPIC_API_KEY="sk-or-v1-xxxxxxxxxxxxxxxxxxxxxxxx" # OpenRouter의 API 키
다만, Claude Code는 기본적으로 claude-3-5-sonnet-*나 claude-3-haiku-*와 같은 Anthropic 모델명을 요청합니다. OpenRouter 측에 이러한 별칭(alias)이 존재하지 않으면 404가 반환되므로, 모델명 매핑이 필요합니다.
{
"model": "google/gemini-2.0-flash-exp:free",
"fallbackModel": "deepseek/deepseek-chat-v3-0324:free"
...
}
fallbackModel을 설정해 두면, 주 모델이 레이트 제한에 도달했을 때 자동으로 폴백(fallback)합니다.
모노레포에서 서비스별로 비용 정책이 다른 경우에는 디렉토리마다 .claude/settings.local.json를 두는 방법이 효과적입니다.
my-monorepo/
├── packages/
│ ├── api/
...
:free 모델은 429 Too Many Requests가 빈번하게 발생합니다. 이를 극복하기 위한 패턴을 소개합니다.
Claude Code의 커스텀 스크립트 호출에 래퍼(wrapper)를 삽입합니다.
import time
import anthropic
def request_with_backoff(client, max_retries=5, **kwargs):
...
여러 :free 모델을 라운드 로빈 방식으로 사용하면 실효 레이트 제한을 분산시킬 수 있습니다.
모델의 레이트 제한은 요청 수(request count)가 아니라 토큰 수(token count)로 관리되는 경우도 있다. 요청의 컨텍스트를 짧게 여러 번으로 분할하는 것보다, 한번에 묶어서 한 번의 요청으로 처리시키는 것이 더 효율적인 경우가 많다.
프롬프트 설계 지침:
❌ 나쁜 예: 파일1 → 응답 대기 → 파일2 → 응답 대기 → 총 2회 요청
✅ 좋은 예: 파일1, 2의 내용을 모아서 한 번의 요청에 담기 → 총 1회 요청
아래는 공개된 벤치마크(HumanEval / SWE-Bench 등)와 실제 코딩 평가를 통해 정리한 모델별 특성입니다.
강점: 1M 토큰이라는 압도적인 컨텍스트 길이. 대규모 코드베이스 일괄 분석에 적합 -
약점: 지시의 미묘한 뉘앙스를 놓칠 때가 있다. 일본어 프롬프트의 정확도는 다소 떨어진다 -
적합한 작업: 레포지토리 전체 의존 그래프 생성, 대량 파일 리팩토링 제안
강점: 235B 파라미터의 추론 능력. 코드와 자연어 혼재 작업에 강하다 -
약점: 32K 컨텍스트이므로 대규모 파일 로딩에는 주의가 필요 -
적합한 작업: TypeScript/Rust/Python 등 다국어 구현 생성
강점: 낮은 레이턴시(latency)와 높은 처리량(throughput). 구현 속도 중시 작업에 최적 -
약점: 복잡한 추론 체인(inference chain)이 필요한 상황에서는 품질이 다소 떨어질 수 있다 -
적합한 작업: 정형적인 보일러플레이트 생성, 테스트 케이스 작성
OpenRouter를 경유해도 일부 모델은 프롬프트 캐시(prompt cache)에 대응하고 있습니다. 캐시를 효과적으로 활용하기 위한 설계 지침:
변하지 않는 부분(코딩 규약・타입 정의・프로젝트 고유의 제약사항)을 시스템 프롬프트의 맨 앞에 고정시키고, 사용자 프롬프트에서는 작업 고유의 내용만 전달합니다.
SYSTEM_PROMPT_STATIC = """
당신은 TypeScript 전문가입니다.
다음 규약을 따라 코드를 생성해 주세요:
...
시스템 프롬프트의 맨 끝에 동적 정보를 넣지 않기(날짜・사용자 이름 등) 컨텍스트의 공통 부분을 대화 초반으로 배치하기-
동일 세션 내에서 동일한 시스템 프롬프트를 반복 사용하기(TTL(Time To Live) 내라면 캐시가 작동함)
| 항목 | 포인트 |
|---|---|
| 엔드포인트 변경 | ANTHROPIC_BASE_URL을 https://openrouter.ai/api/v1로 변경만 하면 됨 |
| 모델 선정 | 작업 특성에 따라 Gemini(장문)・Qwen3(다국어)・DeepSeek(속도)를 적절히 사용하기 |
| 레이트 제한 대책 | Exponential Backoff + 모델 로테이션 + 1 요청 최대화 |
| 비용 최적화 | 시스템 프롬프트 고정화를 통해 캐시 히트율 향상 |
| 주의점 | 무료 티어는 가용성 보장 없음. 중요한 작업에는 유료 모델을 남겨두기 |
모델은 '실제 상업 용도로 사용하지 않는다'가 아니라, 작업의 중요도에 따라 모델을 적절히 분배하여 사용하는 것이 올바른 접근 방식입니다. 문서 생성・테스트 생성・코드 리뷰 보조와 같은 비(非)핵심적인 용도에는 충분히 실용적인 품질을 낼 수 있습니다.
- OpenRouter 모델 목록 (공식)
- OpenRouter API 문서 (공식)
- Claude Code 설정 레퍼런스 (Anthropic 공식)
- Anthropic Python SDK (GitHub)
- HumanEval 벤치마크 (OpenAI Research) — MIT License
- SWE-bench (Princeton NLP) — MIT License
✍️ 본 기고지 저자: 合同会社ジモラボ
지모라보는 하오지(八王子)를 거점으로 AI를 활용한 SaaS를 다수 개발하고 있습니다. 본 기고지의 기술 검증 역시 그러한 개발 과정의 부산물입니다.
- 🌐 공식 사이트: https://locallab.jp
- 🔍 AI SEO 최적화 SaaS: lookupai.jp
- 📺 YouTube: @locallab_llc
- ✉️ 문의: [email protected]
관심 가져주셨다면, 각 SNS 팔로우도 부탁드립니다!
| 체크 항목 | 결과 |
|---|---|
| §4-A〜4-D에 해당하는 기술은 없는가 | ✅ 예 (경쟁사 재현・개인 정보・환경 변수・사내 코드 모두 없음) |
| ... | |
| → 모든 항목 YES. 공개 가능. |
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기