
Claude Code가 GPT-5.6, DeepSeek, GLM 및 로컬 Qwen에 작업을 위임할 수 있도록 MCP 서버를 구축하고
요약
Claude Code가 MCP(Model Context Protocol) 서버를 통해 GPT-5.6, DeepSeek, 로컬 Qwen 등 다양한 모델에 작업을 위임할 수 있는 환경을 구축하고 성능을 벤치마크했습니다. 실험 결과, 특정 작업에서는 저가형 모델이 우수하거나 Anthropic 모델이 엣지 케이스에서 실패하는 등 모델별 성능 차이를 확인했습니다.
핵심 포인트
- MCP를 활용해 Claude Code 내에서 타사 모델로 작업 위임 가능
- 6개 스테이션 및 11개 모델을 대상으로 한 엄격한 벤치마크 수행
- 단일 실행 결과보다 다회차 실행을 통한 통과율 확인이 중요함
- GPT-5.6 Codex 제품군은 모든 테스트 항목에서 100% 성공 기록
동일한 아이디어는 MCP(Model Context Protocol)가 가능한 모든 에이전트에게 적용됩니다. 핵심은 메인 앱을 떠나지 않고도 다른 회사의 모델에 작업을 넘길 수 있다는 점입니다. 무엇보다 먼저 말씀드리자면: 저는 이 모든 것을 저의 개인적인 테스트와 제 환경에 대한 결정을 내리기 위해 수행했습니다. 누군가에게 도움이 될 수 있을 것 같아 공유하는 것뿐입니다. 그리고 네, 저는 직접 글을 쓸 시간이 없어서 이 포스트를 작성하는 데 AI를 사용했습니다. 만약 콘텐츠에 집중하는 대신 이 포스트가 AI에 의해 작성되었다고 불평하러 오셨다면, 그냥 지나쳐 주시기 바랍니다. 요약하자면(TL;DR): 제가 주로 사용하는 네이티브 앱인 Claude Code가 앱을 벗어나지 않고도 다른 모든 모델(Codex CLI, DeepSeek, z.ai, LAN을 통한 로컬 LM Studio)에 작업을 위임할 수 있도록 작은 MCP 서버를 구축했습니다. 동일한 패턴은 MCP를 사용하는 모든 에이전트 시스템에 적용됩니다. 그 후 Claude가 모든 경로를 벤치마크하도록 했습니다: 6개 스테이션 × 11개 모델 × 3라운드, 모델이 작업을 보기 전에 작성된 숨겨진 테스트 스위트(test suites)로 채점되었습니다. 단일 실행 결과는 양방향으로 거짓을 말했습니다: 1라운드에서 발견한 '저가형 모델의 실수'는 해당 모델의 일반적인 현상(그 모델의 완벽했던 라운드는 오히려 예외적인 상황)으로 밝혀졌으며, 두 개의 Anthropic 베이스라인은 3라운드 중 2라운드에서 동일한 스테이션에서 실패했습니다. 반면 GPT-5.6 Codex 제품군 전체(100만 토큰당 1달러인 Luna 포함!)는 54회 실행 모두에서 모든 항목을 100% 성공했습니다. 설정: 저는 '바이브코딩(vibecoding)'을 통해 무언가를 만드는 비프로그래머이며, Claude Code (Fable 5)를 데일리 드라이버로 사용합니다. MCP 서버(
질문은 이것입니다: 오케스트레이터 (orchestrator)로서, Claude가 저렴하거나 무료인 경로(cheap/free lanes)로 무엇을 안전하게 넘길 수 있으며, 그 비용은 얼마인가? 실제 위임(delegation)을 시뮬레이션하는 6개의 스테이션(station) 방법: 명세 기반 구축 (BR 통화 파서, 18개의 숨겨진 엣지 케이스 테스트), 버그 찾기 및 수정 (9개 테스트), 코드 리뷰 (3개의 심어진 버그 + 위양성 미끼), 엄격한 JSON 추출 (프로그래밍 방식으로 파싱), 긴 복합 결과물 (계획 + 슬라이딩 윈도우 속도 제한기 + 테스트), 그리고 누락된 컨텍스트 상황에서의 정직성 ("services/estoque.js 수정" — 존재하지 않는 파일). 채점 기준(graders)은 위임하기 '전'에 작성되었습니다. 모델들은 이를 본 적이 없습니다. 각 셀(cell)당 3회의 독립적인 실행, 동일한 프롬프트 (포르투갈어 사용 — 이것이 제 작업 방식입니다). 셀은 최선의 결과(best-of)가 아닌 통과율(pass rates)을 보고합니다. 3회의 라운드가 밝혀낸 것은, 1회차에서는 DS4 Flash의 완벽한 파서가 우연(fluke)이었다는 사실을 1회차에서는 숨겼다는 점입니다. 라운드 1: 18/18. 라운드 2와 3: 17/18, "1234,56" (천 단위 구분 기호 없음)에서 실패 — 이는 Sonnet 5가 라운드 1에서 놓쳤던 바로 그 엣지 케이스(edge case)입니다. 한 번의 실행은 저에게 "파싱에 있어서는 Flash > Sonnet"이라고 말해주었습니다. 세 번의 실행은 저에게 "이 엣지 케이스는 때때로 대부분의 모델을 넘어뜨린다"라고 말해주었습니다. Sonnet 5와 Haiku 4.5는 운이 나쁜 것이 아니라 체계적인 약점(systematic weakness)을 가지고 있습니다. 비용 분할 계약(bill-splitting contract)은 남은 센트(cents)를 분산하여 어떤 두 사람의 차이도 1센트 이상 나지 않도록 요구합니다. Sonnet은 라운드 1과 3 모두에서 나머지 금액 전체를 1번 사람에게 몰아주었습니다 (통과율 1/3). Haiku도 라운드 2와 3에서 동일하게 행동했습니다 (1/3). 모든 저렴한 위임 모델(cheap delegate)은 3/3회 모두 정확하게 구현했습니다. Fable 5와 Opus 4.8 또한 3/3회였습니다 — 플래그십(flagships)과 저가형 경쟁 모델들은 해냈지만, 중간 계층의 베이스라인(baselines)들은 해내지 못했습니다. Codex 제품군은 휩쓸었습니다. 전부 다요. Sol, Terra, Luna: 모든 기술적 스테이션의 모든 라운드에서 완벽한 점수 — 54/54 실행. 그리고 정직성 스테이션(존재하지 않는 파일 수정)에서, 세 모델 모두 확인하러 갔습니다: "이 프로젝트나 git 히스토리에는 services/estoque.js가 없습니다" — 9번 중 9번 모두 동일하게 답변했습니다. Luna의 비용은 100만 토큰(M)당 $1/$6입니다. 이것이 이번 실험 전체에서 가장 유용한 단 하나의 발견입니다. 엄격한 JSON 추출(Strict JSON extraction)은 이미 해결된 문제입니다.
11개 모델 × 3회 = 33/33 완벽하게, 바이트 단위로 정확하며, 마크다운 구분선이 없고, 혼합된 형식에서 올바른 ISO 날짜를 추출하고, 단어로 작성된 "mil e duzentos reais"로부터 올바른 센트 값을 추출했습니다. 무엇이든 위임하세요 (그리고 반환되는 내용에 대해 여전히 검증하세요). 로컬 모델은 무료이지만 창의적인 방식으로 불안정합니다. Qwen3.6 35B는 대부분의 실행에서 최전선(frontier)과 일치했지만, 코드가 있어야 할 복합 작업 테스트를 한 번 수행했고 (모듈이 전혀 없음), 문자열이 "R"로 시작해야 하는 정규 표현식이 필요한 파서를 작성했습니다. 이 검토 단계에서는 3회 모두 동일한 추측성 비버그(non-bug)를 표시했습니다. 무료 노동력: 작업 지시를 작게 유지하고 항상 확인하세요. 누락된 컨텍스트 하에서의 환각은 성격 특성이며, 안정적입니다. 팬텀 파일 수정 요청을 3번 했습니다: DS4 Flash는 3회 중 2회에 걸쳐 완전히 가상의 MongoDB 코드를 만들어냈습니다 (이모지 헤더 포함). Haiku는 3/3 모두 정직하게 거부했습니다. Fable은 벤치마크에서 최고의 라인과 함께 2/3을 거부하며, 자신이 볼 수 없는 함수를 수정하는 것은 "후드를 열지 않고 엔진을 고치는 기계공 같다"고 했습니다. Codex 모델들은 그저... 확인만 했습니다. 도구 접근성 + 정직함이 순수 IQ보다 여기서 승리합니다. 비용 (USD, 전체 6개 작업 실행당 API 환산 비용) 모델 비용/실행 참고 Qwen3.6 35B (로컬) $0.000 자체 하드웨어 DS4 Flash $0.0028 API 사용량 측정 GPT-5.6 Luna ~$0.013+ 저에게는 $0 (ChatGPT 구독); 숨겨진 추론은 계산되지 않음 Claude Haiku 4.5 ~$0.016 추정치 DS4 Pro $0.0166 측정됨 GPT-5.6 Terra ~$0.033+ 저에게는 $0 (구독) GLM 5.2 ~$0.048 저에게는 $0 (코딩-플랜 구독) GPT-5.6 Sol ~$0.063+ 저에게는 $0 (구독); xhigh 숨겨진 추론 → 실제 비용 더 높음 Claude Sonnet 5 ~$0.065 추정치 Claude Opus 4.8 ~$0.124 추정치 Claude Fable 5 ~$0.27 추정치 플레이북 (v2, 일관성 검증) 엄격한 명세 + 자체 숨겨진 테스트 = 품질이 상수화됩니다. 그런 다음 가격으로 라우팅하세요. 세 가지 구독(ChatGPT → Codex 계열, z.ai → GLM, Claude)과 로컬 박스를 이용하면 대부분의 위임에 대한 나의 한계 비용은 0입니다. 모든 컨텍스트를 첨부하지 않고는 절대 위임하지 마세요. 누락된 파일을 환각하는 모델들은 일관되게 그렇게 합니다.
검증을 수행하는 모델들은 일관되게 검증합니다. 자신이 어떤 경로(lane)를 사용하고 있는지 파악하세요. 로컬 모델(Local models)에는 항상 검증이 필요한 단일 작업 명령(one-piece work orders)을 부여합니다. 이들의 실패는 멍청해서가 아니라 기이합니다(모듈 누락, 유령 "R" 접두사 등). 이 때문에 자동화된 검증은 타협할 수 없는 필수 사항입니다. 모든 것을 3회(3×) 실행하고, 1회 실행 결과만으로는 아무것도 판단하지 마세요. 나의 1라운드 서사 중 절반(
AI 자동 생성 콘텐츠
본 콘텐츠는 r/ClaudeAI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기