AI 코딩 에이전트의 비용을 실측값으로 비교 분석: Codex, Claude Code, Gemini
요약
Codex, Claude Code, Gemini 세 AI 코딩 에이전트의 비용과 성능을 비교 분석했습니다. 성능 차이는 미미하며 가격 구조 역시 사용량 증가에 따른 배율로 동일합니다. 따라서 선택 기준은 '회사가 아닌 필요한 작업 단계(Level)'가 되어야 하며, 실제 운영 비용 측면에서는 토큰 효율성이 높은 Codex가 가장 유리하다는 결론입니다.
핵심 포인트
- 성능 차이는 1~2%p 수준으로 미미하며, 가격 구조도 사용량 증가에 따른 배율로 동일합니다.
- 선택 기준은 서비스 제공사(회사)가 아닌 사용자에게 필요한 작업 단계(Level)를 기준으로 삼아야 합니다.
- 실제 운영 비용을 고려할 때, 토큰 효율성이 높은 Codex가 가장 경제적입니다.
- Claude Code는 편리한 기능(시스템 프롬프트 등) 때문에 초기부터 많은 토큰을 소비하는 경향이 있습니다.
Claude Code를 매일 사용하고 있습니다. 다만 Max 플랜으로 업그레이드할지 반년 정도 고민했었습니다.
그래서 3사(Codex, Claude Code, Gemini)의 요금과 성능을 공개 정보와 제3자의 실측값만을 가지고 비교했습니다. 결과적으로, 선택 기준이 제가 생각했던 것과 달랐기 때문에 공유합니다.
성능으로 선택하던 시대는 이미 끝날 무렵입니다.
| 항목 | 결과 |
|---|---|
| 가격 | 3사 모두 비슷한 수준 (3,000엔 → 15,000엔 → 30,000엔) |
| 가격 차이의 내용 | 사용량만 다를 뿐. 기능적 차이는 없습니다. |
| 성능 (SWE-bench) | Codex 88.7% / Claude Code 87.6% → 차이 1.1 포인트 |
| 토큰 효율 | Codex가 약 4배 유리함 (같은 작업을 할 때 소비량이 1/4 수준) |
| Gemini | 80.6%. 다만 차이가 17점에서 7점으로 줄어들고 있습니다. |
즉, 성능으로도 가격으로도 차이를 느끼기 어려워지고 있습니다.
그렇다면 무엇으로 선택해야 할까요? 여기가 본론입니다.
먼저 요금표를 나열해 보겠습니다.
| 단계 | Codex (ChatGPT) | Claude Code (Claude) | Gemini (Google) |
|---|---|---|---|
| 입문 | Plus $20 (약 3,000엔) | Pro $20 (약 3,000엔) | AI Pro 2,900원 |
| 중급 | Pro $100~ (약 15,000엔~) | Max 5x $100 (약 15,000엔) | AI Ultra 5x 14,500원 |
| 고급 | ― | Max 20x $200 (약 30,000엔) | AI Ultra 20x 32,000원 |
금액뿐만 아니라 배율의 간격까지 동일합니다. '5x', '20x'로 맞춰져 있습니다.
그리고 상위 플랜에서 늘어나는 것은 사용량뿐입니다. 기능적 차이는 없습니다. 가격이 10배가 달라도 할 수 있는 일은 같습니다.
해석: 이는 '어떤 회사를 선택할지'가 더 이상 가격으로 결정되지 않는다는 의미입니다. 선택해야 할 것은 회사가 아니라, 자신에게 필요한 '단계(Level)'입니다.
가격이 같다면, 다음으로 봐야 할 것은 '같은 금액으로 얼마나 오래 작동하는가'입니다.
제3자가 API 경계에서 측정한 결과가 여기 있습니다.
| 같은 작업을 수행할 때의 토큰 소비 | |
|---|---|
| Codex | 1 |
| Claude Code | 최대 4.2배 |
원인도 명확합니다.
Claude Code는 이 프롬프트가 도착하기 전에 약 33,000 토큰을 전송하고 있습니다. 시스템 프롬프트, 툴 스키마, 주입되는 스캐폴드(scaffold) 등이 포함됩니다. 비교 대상인 OpenCode는 약 7,000 토큰입니다. 시작 지점에서 4배 이상의 차이가 납니다.
게다가 서브 에이전트(sub-agent)를 사용하면 직접 실행의 4.2배를 소비합니다. 편리한 기능일수록 비용이 높아지는 구조입니다.
같은 월 $20 → Codex를 사용할 경우 약 4배 더 오래 작동시킬 수 있습니다.
해석: 플랜은 사용량으로 구분되어 있으므로, 이는 그대로 '월 후반에 멈추는지 여부'의 차이가 됩니다. 비용만 본다면 Codex가 유리합니다.
SWE-bench Verified (실제 버그 수정 작업에서 측정하는 공통 테스트) 결과입니다.
| 에이전트 | 정답률 |
|---|---|
| Codex | 88.7% |
| Claude Code | 87.6% |
| Gemini | 80.6% |
상위 두 개의 차이는 1.1 포인트입니다. 100문제 중 1문제의 차이입니다.
하지만, 벤치마크에 나오지 않는 차이가 있습니다.
- 장시간 작업 및 여러 파일을 넘나드는 작업 → Claude Code가 안정적 (컨텍스트 유지력이 강하다는 평가가 여러 비교 기사에서 일치함) -
- 짧은 작업의 응답 속도 → Codex가 빠름 (토큰 소비가 적기 때문에 왕복 시간도 빠름)
해석: '어떤 것이 더 똑똑한가'를 선택하는 단계는 끝났습니다. '나의 작업이 어느 쪽에 가까운가'로 선택해야 하는 단계입니다.
Gemini의 80.6%는 상위 두 개보다 7~8 포인트 낮습니다. 1.1 포인트는 오차 범위일지 몰라도, 7 포인트는 오차가 아닙니다.
다만, 줄어드는 추세를 보세요.
| 시기 | Claude 측 | Gemini 측 | 차이 |
|---|---|
| 이전 | Opus 4.6 — 80.8% | Gemini 2.5 Pro — 63.8% | 17 포인트 |
| 현재 | Claude Code — 87.6% | Gemini CLI — 80.6% | 7 포인트 |
절반 이하로 줄었습니다. 이 기울기가 계속된다면, 어깨를 나란히 하는 날이 올 것입니다.
Gemini CLI는 하루 1,000 리퀘스트까지 무료이며 컨텍스트 창은 100만 토큰입니다. 단순히 사용해 보는 것만으로는 비용이 들지 않습니다.
읽는 방법: 지금 세 번째 순위라도 선택지에서 제외할 단계는 아닙니다.
성능에서도 가격에서도 차이가 없다면, 남는 것은 무엇일까요? 세 가지가 있습니다.
Claude in Chrome이 모든 유료 플랜에 개방되었습니다. Claude Code는 화면을 보고 링크를 누르고, 폼을 채우고, 페이지를 이동할 수 있습니다. 로컬 도구 실행뿐만 아니라 웹상의 조작 자체가 작업 내용으로 포함됩니다.
OpenAI도 같은 영역에 Atlas라는 자체 브라우저로 진입했지만, 공개된 지 292일 만에 폐쇄했습니다. 현재는 Chrome 확장 프로그램에 통합되는 중입니다.
아키텍처의 차이점은 다음과 같이 정리할 수 있습니다.
Anthropic은 브라우저를 AI 안에 넣었습니다. OpenAI는 AI를 브라우저 안에 넣으려고 292일을 들였습니다.
하지만 이 차이는 영구적이지 않습니다. OpenAI의 전환이 완료되면 사라질 것입니다.
| ChatGPT (Codex) | Claude (Claude Code) | |
|---|---|
| 월간 사용자 | 10억 명 | 5,600만 명 |
| 유료 계약 | 5,000만 명 | 비공개 |
| 1사용자당 수익 | $1.74 | $2.76 (1.5배) |
진입 규모가 약 18배입니다. 게다가 Codex는 ChatGPT의 유료 플랜에 포함되므로, 기존 유료 사용자는 추가 비용 없이 사용할 수 있습니다.
반면, 수익성 면에서는 Claude가 우세합니다. 인원은 적지만 충성도 높은 계층이 형성되어 있는 구도입니다.
이것이 제가 조사하면서 가장 무겁게 느낀 지점입니다.
에이전트를 사용할수록 이런 것들이 축적됩니다.
- 작성된 지시서/설정 파일
- 연동된 MCP 서버나 도구
- 진행 중인 작업의 컨텍스트
- 해당 모델의 습관 파악
이것들을 전부 다시 만들어야 합니다.
오늘의 선택 = 향후 몇 년간의 선택
읽는 방법: 반년 후에 다른 회사가 좋아져도, 아마 옮기지 않을 것입니다. 그래서 '일단 사용해 보자'로 결정해서는 안 된다는 것이 제가 조사한 결론이었습니다.
| 논점 | 결론 |
|---|---|
| 가격 | 3사가 나란히 배치됨. 차이는 사용량에만 있음 |
| 비용 효율성 | Codex 유리 (토큰 1/4) |
| 성능 | 차이 1.1 포인트. 선택 불가 |
| Gemini | 17→7 포인트로 축소. 따라잡는 중 |
| 결정적 요인 | 브라우저 조작・사용자 기반・전환 비용 |
성능표를 보며 망설였던 반년은 아마도 헛된 시간이었습니다. 봐야 할 곳이 아니었습니다.
같은 조사 자료를 바탕으로 note에도 작성했습니다. Qiita에 모두 올릴 수 없었던 것은 이 세 가지입니다.
애초에 유료 결제해야 하는지 판정 기준 (무료로만 있어도 되는 사람의 조건 4가지) -
결론적으로 어떤 것을 선택해야 할지 (용도에 따라 2가지로 나뉨) -
앞으로 어느 기업이 우위를 점할지 (예측 5가지・시기 및 확신도 포함)
AI 기사를 1,000개 이상 읽고 Claude Code를 매일 사용하고 있는 제가, Codex・Claude Code・Gemini 중 어떤 플랜을 언제 사야 할지 철저히 해설합니다
- AI의 무료 플랜은 '중단'이 아니라 '사용되지 않게 되는' 형태로 끝난다 ― 무료 플랜이 어떻게 끝날지 공개 정보만으로 조사함
- AI의 1회 질문 가격(전기세)은 얼마인가? ― 추론 1회당 비용을 각 사의 자체 발표 값에서 계산함
| 항목 | 값 |
|---|---|
| SWE-bench Verified | Codex 88.7% / Claude Code 87.6% / Gemini 80.6% |
| ... |
- Claude의 요금 플랜 (Pro / Max 5x / Max 20x)
https://claude.com/pricing - ChatGPT의 요금 플랜 (Free / Go / Plus / Pro)
https://openai.com/chatgpt/pricing/ - Google AI의 요금 플랜 (AI Pro / AI Ultra 5x / 20x)
https://ai.zenken.co.jp/post/gemini-pricing-guide/ - 3개 에이전트 벤치마크 비교
https://fungies.io/best-ai-coding-cli-tools-2026-comparison-2/ - 이전 성능 차이 비교 (Opus 4.6 vs Gemini 2.5 Pro)
https://kanerika.com/blogs/gemini-cli-vs-claude-code/ - 토큰 소비 실측 비교 (API 경계에서 측정)
https://labmemo.com/?p=51536 - Claude Code와 Codex의 토큰 비교
https://artificialanalysis.ai/ja/agents/coding-agents/comparisons/claude-code-vs-codex - Chrome 내 Claude와 Atlas 비교
https://www.usecarly.com/blog/claude-in-chrome-vs-openai-atlas/ - ChatGPT 사용자 수
https://www.mobileworldlive.com/ai-cloud/chatgpt-hits-1b-user-mark-in-record-time/ - Claude의 사용자 수와 수익성
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기