
«Everything Claude Code»: 리미트가 어디로 사라지는가 - 스킬, 서브 에이전트 및 MCP별 소모량
요약
Claude Code 사용 시 발생하는 토큰 소모량과 리미트 제한 문제를 분석합니다. 오픈 소스 프로젝트인 ECC(Everything Claude Code)가 제공하는 다양한 스킬과 에이전트가 컨텍스트를 어떻게 점유하는지, 그리고 효율적인 사용을 위한 보고서 활용법을 다룹니다.
핵심 포인트
- Claude Code의 리미트는 슬라이딩 윈도우 방식의 할당량임
- ECC 프로젝트의 방대한 스킬과 에이전트는 컨텍스트 소모를 가속화함
- 내장 보고서를 통해 스킬, 서브 에이전트, MCP별 소모량 확인 가능
- 효율적인 사용을 위해 토큰이 새어나가는 지점을 파악하는 것이 중요함
5시간 제한이 오후 2시에 끝났습니다. 당신은 무거운 작업을 수행하지 않았습니다: PR 두 개를 리뷰하고, 서브 에이전트 (sub-agents) 몇 개를 실행하고, 테스트를 수정했을 뿐입니다. 이러한 일들은 '생산성' 툴셋 (toolset)을 설치한 이후 흔한 일이 되었습니다. 겉보기에는 작업량이 적어 보이지만, 리미트 (limit) 창은 이미 뚫려 버립니다.
무작정 범인을 찾을 필요는 없습니다: Claude Code에는 스킬 (skills), 서브 에이전트 (sub-agents), 플러그인 (plugins), 그리고 MCP 서버별 소모량을 백분율로 나누어 보여주는 내장 보고서가 있습니다. Anthropic의 공식 문서(2026년 7월 19일 확인)를 따라가며, 토큰 (tokens)이 어디로 새어나가는지, 그리고 어떻게 대처해야 하는지 분석해 보겠습니다.
구독 리미트 (subscription limit)는 슬라이딩 윈도우 (sliding windows) 방식의 할당량입니다. 이를 달러로 계산되는 API 비용이나 로컬의 대략적인 사용량 (/usage) 할당과 혼동해서는 안 됩니다. 계획은 이렇습니다: 먼저 누가 소비하는지 찾아낸 다음, 무엇에 대해 전액을 지불할 가치가 있는지 결정하는 것입니다. 참고로, 동일한 모델들에 대해 공식 요금제로 루블 접근을 제공하는 것은 provod.ai (러시아의 OpenRouter)입니다. 가격 이야기는 마지막 부분에서 다시 다루겠습니다.
Everything Claude Code란 무엇이며, 왜 이것을 사용하면 리미트가 더 빨리 소진되는가?
요약하자면: 이것은 ECC라고 불리는 오픈 소스 (open-source) 프로젝트로, 이전 명칭은 Everything Claude Code였으며, affaan-m/ECC 리포지토리(repository)입니다. 67개의 에이전트 (agents), 278개의 스킬 (skills), 훅 (hooks), 규칙 (rules), 그리고 MCP 설정 (configs)이 하나로 통합되어 있습니다. 이 확장 기능은 작업 속도를 정직하게 높여주지만, 각 레이어 (layer)는 컨텍스트 (context)이며, 컨텍스트는 곧 당신의 리미트에서 차감되는 토큰 (tokens)입니다.
이 프로젝트는 Affaan Mustafa가 Claude Code에서 10개월 이상의 매일 같은 작업을 통해 구축했습니다. GitHub에서 그의 닉네임은 affaan-m이며, 사람들은 단순히 affaan으로 리포지토리를 검색하기도 합니다. 2026년 7월 기준, 이 프로젝트는 211.9k개의 스타 (stars)와 32.5k개의 포크 (forks)를 보유하고 있으며 (수치는 매주 증가 중), MIT 라이선스를 따르며, 메이저 릴리스 (major release) v2.0.0은 2026년 6월에 이루어졌습니다. Claude Code, Codex, Cursor, 그리고 OpenCode 위에서 작동합니다.
«everything claude code»라는 요청이 바로 그것입니다. 문제는 산술적인 부분에 있습니다. 컨텍스트(Context)에는 항상 스킬(Skills) 목록이 존재하며, 세션이 끝날 때까지 호출될 경우 SKILL.md가 포함됩니다. 서브 에이전트(Sub-agents)는 별도의 창에서 작동합니다. 이는 각각 별개의 소모 항목이며, 278개의 스킬과 67개의 에이전트가 동시에 로드되는 것이 아닙니다. 레이어별로 살펴보겠습니다.
리미트(Limits)의 구조: 5시간, 1주일, 그리고 채팅과의 통합 풀
요약하자면: 모든 유료 플랜은 이동식 5시간 윈도우(Rolling 5-hour window) 내에서 리미트가 초기화되며, 그 위에 주간 상한선(Weekly ceiling)이 존재합니다. 또한, 브라우저에서의 Claude 사용량과 Claude Code의 사용량은 통합되어 관리됩니다. /model 명령어를 통해 모델을 전환하더라도 윈도우는 초기화되지 않으며, 모든 모델은 동일한 윈도우를 공유합니다.
2026년 7월 19일 기준 Anthropic의 가격 페이지에 따르면: Pro는 월 $20(연간 결제 시 $17), Max는 $100부터(Pro의 5배 또는 20배 단위), Team은 사용자당 $25입니다. 회사는 리미트의 절대적인 수치는 공개하지 않고 배수(Multiples)만 공개하므로, 정확한 상한선을 미리 계산할 수는 없습니다.
올해의 역사는 시사하는 바가 큽니다. 2026년 3월 26일, Anthropic은 피크 시간대의 5시간 리미트를 축소했으며, 약 7%의 사용자가 처음으로 상한선에 도달했습니다. 2026년 5월 6일, 피크 시간대 축소 조치는 취소되었고 Pro, Max, Team 및 시트 기반(Seat-based) Enterprise 플랜의 리미트는 두 배로 늘어났습니다. 이는 SpaceX와의 Colossus 1 데이터 센터(300MW 이상, 22만 개의 GPU 보유) 접근 계약을 배경으로 한 조치였습니다. 리미트는 늘어나고 있지만, 확장 도구(Add-ons)들의 식탐은 더 빠르게 늘어나고 있습니다.
누가 리미트를 소모했는지 확인하는 방법: /usage, /context 및 /doctor
요약하자면: 유료 플랜에서 /usage 명령어를 사용하면 스킬(Skills), 서브 에이전트(Sub-agents), 플러그인(Plugins), 그리고 개별 MCP 서버별 사용량을 백분율로 나누어 보여줍니다. d와 w 키를 누르면 '최근 24시간'과 '최근 7일' 사이를 전환할 수 있습니다. VS Code 확장 프로그램에서는 동일한 표가 Account & usage 대화 상자에 있으며, Claude Code v2.1.174 이상의 버전이 필요합니다.
두 가지 주의사항이 있습니다. 수치는 근사치이며 로컬 기준입니다. 즉, 이 컴퓨터의 세션을 기준으로 계산되며, 다른 기기나 claude.ai에서의 사용량은 여기에 포함되지 않습니다. 또한 /usage는 최근 사용량의 10% 이상을 차지한 항목(캐시 미스, 긴 컨텍스트, 집중적인 서브 에이전트 등)을 스스로 강조 표시하며, 각 플래그에 대한 조언을 함께 제공합니다.
두 가지 명령어가 있습니다. /context는 현재 스킬(Skills)이 차지하고 있는 창의 크기를 보여주는 'Skills' 행을 표시하며, /doctor는 해당 스킬들의 리스팅(listing) 비용을 평가합니다. 2026년 7월 19일 기준 최신 버전인 2.1.215에서는 Claude가 /verify 및 /code-review를 스스로 실행하지 않고, 명시적인 호출이 있을 때만 실행하도록 변경되었습니다. 보고서 내의 플러그인(Plugins)은 별도의 행으로 표시되며, /plugin marketplace add anthropics/claude-plugins-official과 같은 명령어를 통해 공식 마켓플레이스에서 설치할 수 있습니다. 이 마켓플레이스는 Anthropic 조직이 GitHub에서 관리합니다. 각 플러그인은 청구서의 잠재적인 한 줄이 됩니다.
스킬의 비용: 리스팅 임대료와 떠나지 않는 본문
요약하자면: 스킬은 두 번 비용을 지불합니다. 첫 번째는 '임대료'입니다. 모든 스킬의 이름과 설명 리스팅이 컨텍스트 창(context window)의 최대 1%를 지속적으로 점유합니다. 두 번째는 호출 시 발생하는 비용입니다. 렌더링된 SKILL.md가 컨텍스트에 포함되며 세션이 끝날 때까지 그곳에 남아 있습니다.
Skills 문서에 명시된 메커니즘에 따르면, 스킬의 description + when_to_use 조합은 1,536자까지 잘립니다. 리스팅 예산이 초과되면 호출 빈도가 낮은 설명부터 순차적으로 잘라냅니다. 호출 시 스킬의 본문은 하나의 메시지로 전달되며, 문서는 다음과 같이 단호하게 규정합니다:
"Every line is a recurring token cost"
- Anthropic, Skills 문서
번역: "모든 줄은 반복되는 토큰 비용입니다."
자동 압축(auto-compaction) 시, 스킬은 예산에 따른 요약(summary) 이후에 다시 가중치가 부여됩니다: 각 스킬의 처음 5,000 토큰, 총합 25,000 토큰을 넘지 않도록 하며, 오래된 스킬은 완전히 삭제될 수 있습니다. 최근 변경 로그(changelog)를 살펴보면, v2.1.202는 재호출 시 로드된 스킬이 중복되는 문제를 해결했으며, v2.1.199는 한 메시지에 최대 5개의 스킬을 스택(stack)할 수 있도록 허용했습니다. 이는 편리하면서도 동시에 5개의 본문을 한 번에 로드할 수 있는 방법이기도 합니다. 결론: 가벼운 SKILL.md를 유지하고 사용하지 않는 스킬을 언로드(unload)하는 것이 가장 저렴한 절약 방법입니다.
서브 에이전트(Sub-agents): 별도의 창인가, 이중 청구인가?
요약하자면: 둘 다 해당됩니다. 각 서브 에이전트는 자체적인 컨텍스트 창에서 작동하며 중간 단계로 인해 메인 대화가 부풀려지지 않으므로 이는 비용 절감 요소입니다. 하지만 해당 에이전트의 창은 별도의 비용이 발생하며, 결과 요약이 대화로 반환되면서 메인 대화를 채우게 됩니다.
Subagents(서브 에이전트) 문서에 따르면: 서브 에이전트는 자신의 시스템 프롬프트(System Prompt)와 기본 환경(Base Environment)만을 전달받으며, 다른 서브 에이전트를 생성할 수 없습니다. 자동 압축(Auto-compaction)은 컨텍스트 창(Window)의 약 95% 지점에서 작동합니다. 내장된 Explore 기능은 Haiku 모델을 기반으로 작동하며, 빠르고 읽기 전용(Read-only)이며 의도적으로 저렴하게 설계된 역할입니다.
다음은 규모의 산술입니다. Agent teams(에이전트 팀), 즉 각자의 컨텍스트 창을 가진 Claude Code의 병렬 인스턴스들은 동료(Teammates)들이 계획 모드(Plan mode)에서 작동할 때 일반 세션보다 약 7배 더 많은 토큰을 소비합니다. 이 기능은 기본적으로 비활성화되어 있습니다 (CLAUDE__CODE__EXPERIMENTAL__AGENT__TEAMS=1). 그리고 v2.1.212 버전에는 '폭주하는' 위임(Delegation) 루프를 방지하기 위한 안전장치가 도입되었습니다: 세션당 서브 에이전트 생성 최대 200개 제한 (CLAUDE__CODE__MAX__SUBAGENTS__PER__SESSION).
MCP 서버: 도구에 부과되는 보이지 않는 세금
요약하자면: 컨텍스트로의 지연 로딩(Lazy loading) 시, 처음에는 MCP 도구의 이름만 포함되며 설명(Description)은 호출될 때마다 불러옵니다. 설명이 컨텍스트 창의 10%를 초과할 경우 MCP Tool Search가 자동으로 활성화됩니다. 기본적으로 단일 호출의 출력은 25,000 토큰으로 제한됩니다. 컨텍스트 창이 200k에서 ~70k로 압축되는 현상은 6개의 서버를 사용해서 발생하는 효과라기보다, ECC FAQ에서 언급된 가능한 사례 중 하나입니다.
리포지토리 FAQ 인용:
“Too many MCP servers eat your context... Each MCP tool description consumes tokens from your 200k window, potentially reducing it to ~70k”
- FAQ ECC, GitHub
번역: “너무 많은 MCP 서버가 컨텍스트를 잡아먹습니다... 각 MCP 도구 설명이 당신의 200k 창에서 토큰을 소비하여, 잠재적으로 이를 ~70k까지 줄일 수 있습니다.”
따라서 2026년 6월, ECC는 기본 커넥터(connector)를 6개에서 1개(chrome-devtools)로 줄였으며, 나머지는 선택 사항(opt-in)으로 변경했습니다. Anthropic은 자체적인 조절 장치를 가지고 있습니다. 도구 정의(tool definitions)를 지연시키고, 설명이 컨텍스트 창의 10%를 초과할 경우 MCP Tool Search를 자동으로 활성화합니다. 이는 ENABLE_TOOL_SEARCH 변수로 제어됩니다 (기본값은 auto, auto:5는 사용자 지정 임계값, false는 모두 로드). 이 기능은 Sonnet 4+ 및 Opus 4+에서 작동하며, Haiku에서는 지원되지 않습니다. 출력(output)에 대해서는, 호출당 10,000 토큰을 초과하면 경고가 표시되며, MAX_MCP_OUTPUT_TOKENS를 통해 25,000 토큰의 엄격한 상한선(hard ceiling)을 높일 수 있습니다.
또한 서버가 어떤 도메인(domains - user, project, local)에 정의되어 있는지 확인하십시오. user 레벨에 정의되면 필요하지 않은 프로젝트를 포함한 모든 프로젝트에 비용을 부과하게 됩니다. 예시: 공식 플러그인 리포지토리의 issue #754(2026년 3월 19일)에 따르면, Vercel 플러그인이 훅(hooks)을 통해 최대 57KB의 session-start 컨텍스트를 주입하여 컨텍스트 창이 작은 모델의 작동을 방해했습니다.
| 계층 | 소비 항목 | 측정 방법 | 감소 레버 (Lever) |
|---|---|---|---|
| 스킬 (Skills) | 리스팅(Listing) ~창의 1% + 세션 종료 시까지의 본문 | /context, Skills 행; /doctor | 정교한 SKILL.md 작성, 불필요한 항목 제거 |
| ... |
무턱대고 모든 것을 잘라내서는 안 됩니다. /usage를 열어 지난 7일간의 데이터를 확인하고 표와 대조해 보십시오. 어떤 사용자는 스킬(skills) 때문에 과부하가 걸리고, 다른 사용자는 몇 개의 "무거운" MCP 서버 때문이며, 또 다른 사용자는 서브 에이전트(sub-agent)에 과도하게 의존하는 문제일 수 있습니다. 보편적인 해결책은 없으며, 당신만의 해결책이 있을 뿐입니다. 표의 수치는 2026년 7월 Anthropic 문서 기준입니다.
컨텍스트 창이 200k에서 ~70k로 압축된 ECC의 사례는 그 어떤 조언보다 명확합니다. 기본 설정된 6개의 서버가 프로젝트 컨텍스트의 3분의 2를 차지했습니다. 아래 이미지가 이를 보여줍니다.

숨겨진 비용: thinking, 비대한 CLAUDE.md 및 백그라운드
요약하자면: 세 가지 비용 항목은 사용자의 개입 없이 작동합니다. Thinking 토큰은 출력(output)으로 과금되며, 기본적으로 요청당 수만 개의 토큰이 소모됩니다. CLAUDE.md는 관련 없는 작업일지라도 매 세션 시작 시 로드됩니다. 백그라운드 요약(summarization) 및 서비스 점검 비용은 세션당 $0.04 미만입니다.
Costs 페이지에 따르면: Thinking의 기본 예산은 요청당 수만 개의 토큰이며, /effort 또는 MAX_THINKING_TOKENS를 통해 줄일 수 있습니다. 일상적인 수정 작업에는 전체 예산을 사용하여 "생각"할 필요가 없습니다. CLAUDE.md는 공식 권장 사항에 따라 200행 이내로 유지하고, 전문적인 지침은 스킬(skills)로 옮기십시오. 스킬은 필요할 때만 로드됩니다. 훅(Hooks)은 또 다른 합법적인 압축 도구입니다. 문서의 예시를 보면 테스트 출력을 실패한 부분까지만 필터링하여, 수만 개의 로그 토큰을 수백 개로 압축합니다. 백그라운드 작업은 건드리지 않는 것이 좋습니다. 세션당 $0.04를 아끼기 위해 수고를 들일 가치가 없습니다.
한도를 하루 종일 유지하기 위해 오늘 해야 할 일
요약하자면: /usage를 열고, 가장 상단의 할당(attribution) 항목을 찾아 그것만 줄이십시오. 보통 다섯 단계면 충분합니다.
- 최근 7일간의
/usage를 확인하고(w 키), 가장 많이 소비하는 항목(스킬, 서브 에이전트 또는 특정 MCP 서버)을 기록하십시오. /context와/doctor를 확인하십시오: 스킬 목록이 컨텍스트 창을 얼마나 차지하는지 확인하고, 불필요한 항목은 내보내고 긴 설명은 압축하십시오.- 기본적으로 하나의 MCP 커넥터만 남겨두고, 나머지는 ECC 정책처럼 선택적(opt-in)으로 사용하십시오. Tool Search가 활성화되어 있는지 확인하십시오.
- 백그라운드 서브 에이전트를 저렴한 모델 클래스로 전환하고(Explore는 이미 Haiku 사용 중), 생성(spawn) 상한선을 설정하십시오.
- CLAUDE.md를 200행 이내로 줄이고, 상세 지침은 스킬로 옮기십시오. 일상적인 작업 시에는
/effort를 낮추십시오.
유용한 환경 변수 - 실행 전 셸(shell)에서 내보내기(export) 하십시오:
ENABLE_TOOL_SEARCH=auto # MCP 설명이 컨텍스트 창의 10%를 초과할 때 Tool Search 활성화
MAX_MCP_OUTPUT_TOKENS=25000 # 단일 도구 출력의 엄격한 상한선
CLAUDE_CODE_MAX_SUBAGENTS_PER_SESSION=200 # 위임 루프 방지를 위한 스톱워치 (v2.1.212)
이 설정으로 해결할 수 없는 것
요약하자면: 청소(clearing)가 한도 모델 자체를 취소하지는 않습니다. 아무리 최적화를 하더라도 5시간 윈도우(window)와 주간 상한선은 그대로 유지됩니다.
/clear는 세션 비용의 로컬 카운터(local counter)만 초기화하며(이조차 v2.1.211에서야 수정되었습니다), 구독 기반의 서버 측 윈도우에는 영향을 주지 않습니다. 구독에서 API로 전환하는 것은 투명성의 문제이지 무료화가 아닙니다. 돈은 여전히 나가지만, 어디로 나가는지 보일 뿐입니다. 또한 에이전트 팀(agent teams)은 절약 도구가 아닌 속도 도구입니다. 플랜 모드(plan mode)에서의 7배 소모는 병렬성(parallelism)에 대한 대가입니다.
역할별 모델: 비용 구조를 변경하는 방법
요약하자면: 청소 이후의 두 번째 레버(lever)는 모든 것에 하나의 모델을 사용하는 것이 아니라, 역할에 맞는 모델을 사용하는 것입니다. 2026년 7월 19일 기준 Anthropic의 공식 가격표에 따르면, 클래스 간의 차이는 수십 배에 달합니다.
백만 토큰당 입력/출력(input/output) 가격: Fable 5는 $10/$50, Opus 4.8은 $5/$25, Sonnet 5는 2026년 8월 31일까지의 도입 가격 기준 $2/$10(이후 $3/$15), Haiku 4.5는 $1/$5입니다. 프롬프트 캐시(prompt cache) 읽기는 입력(input)보다 약 10배 저렴합니다. Opus 4.8의 경우 캐시 읽기(cache read)는 백만 토큰당 $0.50입니다. 여기서 도출되는 전략은 다음과 같습니다: 아키텍처 설계와 최종 리뷰는 최상위 모델(top-model)에 맡기고, 검색, 초안 작성 및 서브 에이전트(sub-agent) 루틴은 Haiku급 모델에 맡기십시오. 품질을 유지하면서 월간 비용을 바꾸고 싶다면, 프롬프트가 아닌 역할(role)부터 시작하십시오.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기