
Codex Ultra는 에이전트 군단을 가동하며 예산을 태웁니다: 누구에게 수익성이 있는가
요약
OpenAI가 출시한 Codex Ultra 모드는 GPT-5.6 Sol 모델을 기반으로 멀티 에이전트 오케스트레이션을 수행합니다. 이 모드는 작업을 병렬로 처리하여 속도와 지능을 높이지만, 토큰 소모량이 2~12배까지 급증할 수 있어 작업 유형에 따른 비용 효율성 분석이 필수적입니다.
핵심 포인트
- Ultra 모드는 작업을 서브 에이전트로 분해하여 병렬 실행하는 멀티 에이전트 방식임
- 토큰 소모량이 기존 대비 최소 2배에서 최대 12배까지 증가할 수 있음
- 대규모 리팩터링에는 유리하나, 단순 버그 수정에는 비용 낭비가 될 수 있음
- Terminal-Bench 2.1 기준 91.9%의 높은 성능을 기록함
Ultra를 활성화할지 결정하기: 15분 소요 · 과다 지불 방지: Ultra가 불필요한 작업당 $30-75까지 (외부 평가) · 수준: 중급 · 읽기 시간: 약 30분 · 데이터 기준일: 2026년 7월 10일
학습 내용:
- GPT-5.6 Sol 모델 기반 Codex의 Ultra 모드란 무엇이며, 왜 멀티 에이전트 (Multi-agent)라고 불리는가 (2026년 7월 9일 GA 출시)
- 오케스트레이터 (Orchestrator)가 작업을 서브 에이전트 (Sub-agents)로 어떻게 분해하는지 (최대 6개 스레드, 중첩 깊이 1) 및 실제로 이들이 어떻게 조정되는지
- 비용이 얼마나 더 비싼가: OpenAI의 공식 배수는 없으며, 외부 평가에 따르면 토큰 소모량이 2-4배에서 6-12배까지 차이 남
- Ultra가 수익성이 있는 경우와 과다 지불인 경우: 11가지 작업 유형별 표 및 OpenAI의 직설적인 권장 사항
- 벤치마크 (Benchmark) 정직한 비교: Terminal-Bench 2.1에서 91.9% 대 88.8% 기록 - 그리고 왜 METR가 에이전트 측정에 대한 신뢰를 떨어뜨렸는가
- 이 모드가 Claude Code, Cursor, Devin, Google의 서브 에이전트와 어떻게 다른지, 그리고 러시아에서의 접속 방법
핵심 요약. 2026년 7월 9일, OpenAI는 GPT-5.6 라인업 (Sol, Terra, Luna)을 일반에 공개했으며, 이와 함께 Codex의 Ultra 모드를 출시했습니다. 검색 시 사람들은 이를 "코덱스 GPT"라고 입력합니다. Ultra는 GPT-5.6 Sol 모델의 최상위 "지능" 수준으로, Codex가 스스로 작업을 분해하고 여러 에이전트를 병렬로 실행합니다. 이에 대한 비용은 토큰으로 지불합니다. OpenAI는 정확한 배수를 밝히지 않았으나, 외부 평가에서는 2-4배에서 6-12배까지 의견이 갈립니다. 규모가 크고 분해 가능한 작업에서는 시간 대비 효율(ROI)이 높습니다. 하지만 작은 수정이나 루틴한 작업에서는 돈을 낭비하게 됩니다. 아래에서 그 경계선을 확인하세요.
당신은 Codex에 작업을 주었지만, Codex는 단 하나의 에이전트 대신 네 개를 일으켜 세웠습니다. 당신이 첫 번째 답변을 읽는 동안, 네 개의 병렬 스레드는 이미 리포지토리 (Repository)를 훑고, 테스트를 실행한 뒤, 메인 채팅창으로 요약본을 돌려주었습니다. 마법 같고 시간을 절약해 주는 것처럼 보입니다. 하지만 곧 당신은 사용량 제한 (Limits) 소모를 보게 될 것입니다. 단 하나의 작업에 이전에는 하루 종일 쓸 수 있었던 만큼의 토큰이 날아갔기 때문입니다.
이것이 바로 Ultra 모드입니다. OpenAI는 이를 솔직하게 '효율성보다는 지출의 레버리지'라고 부릅니다. 이 모드는 더 강력하고 빠르게 결과를 제공하기 위해 의도적으로 토큰 소모량을 높입니다. 질문은 Ultra가 얼마나 똑똑한지가 아니라, 당신의 특정 작업이 이러한 추가 비용을 상쇄할 만큼 가치가 있는지 여부입니다. 전체 리포지토리를 거치는 대규모 리팩터링이라면 아마 그럴 것입니다. 하지만 단일 파일의 버그 수정이라면 거의 확실하게 그렇지 않을 것입니다.
순서대로 분석해 보겠습니다. Ultra가 무엇이며 어떤 모델에서 작동하는지, 에이전트 오케스트레이션이 어떻게 구성되어 있는지, 그리고 실제로 얼마나 더 비싼지에 대해 다룰 것입니다. 언제 비용을 상쇄하고 언제 과도한 지출인지 말입니다. 벤치마크는 무엇을 보여주는지, 이 모드가 Claude Code나 Cursor와 어떻게 다른지도 살펴볼 것입니다. 그리고 ChatGPT나 Codex가 공식적으로 열리지 않는 러시아에서 이 모든 것을 어떻게 할 수 있는지에 대해서도 다룰 것입니다. 수천 명의 개발자와 팀들이 이미 단일 API를 통해 OpenAI 모델로 코드를 구동하고 있다는 점은 마지막에 솔직하게 다루겠습니다. 여기에는 어그리게이터(aggregator)가 제공할 수 없는 내용까지 포함됩니다.
Codex의 Ultra 모드란 무엇이며, 왜 '멀티-에이전트'인가?
핵심. Ultra는 Codex에서 가장 높은 수준의 '지능'(intelligence level)입니다. 이 이름으로 된 별도의 모델이나 제품은 없습니다. 이는 2026년 7월 9일에 일반에 공개된 플래그십 모델 GPT-5.6 Sol 위에서 작동합니다. Ultra가 다른 레벨과 구별되는 점은 능동적인 위임(proactive delegation)입니다. 즉, 사용자의 명시적인 요청 없이도 모델 스스로 작업을 하위 작업으로 분해하고 이를 병렬 서브에이전트들에게 할당한다는 것입니다.
먼저 이름의 혼란을 해소하겠습니다. OpenAI에는 'Codex Ultra'라는 별도의 제품은 없습니다. GPT-5.6 Sol이라는 모델과 그 작동 레벨들의 집합체가 있으며, 이는 Codex 문서에서 intelligence levels라고 불립니다. Ultra는 이 중 가장 높은 수준입니다. 직역하면 다음과 같습니다:
«선택한 모델에 따라 사용 가능한 지능 수준(intelligence levels)에는 Light, Medium, High, Extra High, Max가 포함될 수 있습니다... Ultra는 자격이 있는 계정 및 지원되는 모델에서만 사용할 수 있습니다. 이는 최대의 추론(reasoning)을 사용하며 ChatGPT가 적절한 작업을 서브 에이전트(subagents)에게 선제적으로 위임할 수 있도록 합니다» - 사용 가능한 수준: Light, Medium, High, Extra High, Max이며, Ultra는 적합한 계정 및 모델에서만 사용할 수 있고, 최대의 추론(reasoning)을 사용하며 ChatGPT가 서브 에이전트(subagents)에게 작업을 선제적으로 위임할 수 있게 합니다.
- Codex 문서, developers.openai.com/codex (learn.chatgpt.com/docs로 리다이렉트), 2026년 7월 10일 추출, 영어에서 번역.
모델 자체는 새롭습니다. 2026년 6월 26일, OpenAI는 세 가지 '레벨'로 구성된 GPT-5.6 라인업의 프리뷰를 발표했습니다: Sol(플래그십), Terra(중간 단계, 더 저렴함), 그리고 Luna(가장 빠르고 저렴함)입니다. 일반 공개는 2026년 7월 9일 ChatGPT, Codex, API에서 동시에 시작되었습니다. Ultra에 대한 OpenAI의 공식 설명은 다음과 같습니다:
«Ultra는 우리의 가장 높은 성능 설정으로, 복잡한 작업을 더 빠르게 완료하기 위해 병렬 워크스트림(workstreams) 전반에 걸쳐 여러 에이전트를 조정합니다» - Ultra는 우리의 가장 높은 성능 설정으로, 복잡한 작업을 더 빠르게 완료하기 위해 병렬 워크스트림(workstreams) 전반에 걸쳐 여러 에이전트를 조정합니다.
- OpenAI, GPT-5.6 발표, openai.com, 2026년 7월 9일, 영어에서 번역.
러시아어권 인터넷(Runet)에서는 이 도구를 'Codex GPT', 'Codex 신경망', 'ChatGPT Codex' 등으로 검색합니다. 이 모든 검색어의 대상은 사용자의 로컬 머신이나 클라우드에 있는 리포지토리(repository)를 수정하는 OpenAI의 코드용 콘솔 및 데스크톱 에이전트입니다. Ultra는 단지 이 도구의 가장 강력하고 가장 자원을 많이 소모하는 작동 모드일 뿐입니다.
Ultra가 Max 및 다른 수준과 다른 점. 차이점은 Ultra가 '더 깊게 생각한다'는 점에 있지 않습니다. 단일 에이전트에 대한 최대치의 추론(reasoning) 깊이는 이미 Max 수준에서 제공됩니다. Ultra는 그 위에 다른 기능을 추가합니다: 바로 스스로 위임할 수 있는 권한입니다.
«대부분의 지능 수준에서는 서브에이전트(subagents)나 병렬 에이전트 작업을 직접 요청해야 합니다. Ultra는 선제적 위임(proactive delegation)을 가능하게 하여, ChatGPT가 별도의 요청 없이도 적절한 독립 작업을 위임할 수 있습니다» - 대부분의 수준에서는 서브에이전트나 병렬 작업을 명시적으로 요청해야 하지만, Ultra는 선제적 위임을 포함하므로 ChatGPT가 별도의 요청 없이도 적절한 독립 작업을 위임할 수 있습니다.
- Codex 문서, learn.chatgpt.com/docs, 2026년 7월, 영어에서 번역됨.
즉, Ultra 이전 단계의 수준에서도 서브에이전트는 사용 가능합니다. 이들은 이미 2026년 3월 16일에 Codex에 도입되었습니다. 다만, 사용자가 수동으로 호출해야 한다는 차이가 있습니다. Ultra 단계에서는 모델이 스스로 작업을 살펴보고, '이 작업은 병렬로 처리하는 것이 유리하니 군단(swarm)을 가동하겠다'라고 결정합니다. 바로 이 자율성 때문에 이 모드는 강력하면서도 동시에 지갑에는 위험합니다. '더 많이 지출하기'라는 결정을 사용자 없이 모델 스스로 내리기 때문입니다.
신뢰를 위해 알아두어야 할 또 다른 세부 사항이 있습니다. 79페이지 분량의 공식 GPT-5.6 시스템 카드(System Card, OpenAI, 2026년 7월 9일)에는 'Ultra'라는 단어가 단 한 번도 언급되지 않습니다. 그곳의 모든 측정은 gpt-5.6-sol, gpt-5.6-terra, gpt-5.6-luna 모델을 대상으로 수행되었습니다. 이는 Ultra가 Sol 모델 위에 구축된 제품 레이어(product overlay)임을 간접적으로 확인해 줍니다. 'Ultra'라는 이름으로 별도 학습된 체크포인트(checkpoint)는 존재하지 않습니다. '근본적으로 새로운 아키텍처'라는 마케팅적 약속을 접할 때 이 점을 명심하십시오.
Codex는 어떻게 작업을 에이전트로 분해하는가 - 그리고 그들은 실제로 협업하는가?
핵심 요약. 공식 문서에 따르면 구조는 간단합니다: 메인 스트림(오케스트레이터, orchestrator)이 작업을 분해하고, 서브에이전트를 생성하며, 그들의 결과를 기다린 후 취합합니다. 서브에이전트는 메인 스트림으로 요약본을 반환합니다. 한계치는 최대 6개의 병렬 스트림이며, 중첩 깊이(nesting depth)는 1입니다(서브에이전트가 자신의 서브에이전트를 생성할 수 없음). 언론에서는 에이전트들이 "서로 협력하고 소통하도록 학습되었다"라고 보도하지만, 초기 문서나 시스템 카드(System Card)에는 이러한 표현이 없습니다. 이는 중요한 유의 사항입니다.
Codex의 메커니즘은 다음과 같이 기술되어 있습니다:
«ChatGPT 또는 Codex가 새로운 하위 에이전트(subagents) 생성, 후속 지침 라우팅(routing), 결과 대기 및 에이전트 스레드 종료를 포함하여 에이전트 간의 오케스트레이션 (orchestration)을 처리합니다» - ChatGPT or Codex handles orchestration across agents, including spawning new subagents, routing follow-up instructions, waiting for results, and closing agent threads.
- Codex의 하위 에이전트(subagents) 관련 문서, developers.openai.com/codex/subagents, 2026년 7월 10일 추출, 영어에서 번역됨.
이것이 실제로 어떻게 작동하는지 단계별로 살펴보겠습니다:
- 오케스트레이터(Orchestrator)가 작업을 받습니다. 메인("루트") 에이전트가 요구 사항, 결정 사항 및 최종 결과를 집중적으로 관리합니다.
- 작업을 하위 작업으로 분할하고 각 작업에 맞는 하위 에이전트(subagents)를 생성합니다. 예를 들어, 코드 탐색을 위한 "explorer"나 수정을 위한 "worker" 등이 있습니다. 역할은
~/.codex/agents/에 있는 사용자 정의 TOML 파일로 지정할 수 있습니다. - 하위 에이전트들은 병렬로 작동하며, 각자 자신의 스레드와 샌드박스(sandbox) 내에서 작업합니다 (하위 에이전트는 사용자의 샌드박스 정책을 상속받습니다).
- 하위 에이전트들은 메인 스레드로 요약본을 반환합니다. 가공되지 않은 중간 출력물은 하위 에이전트 단계에 머물러 있습니다. 문서는 다음과 같이 직접 권장합니다: "Return summaries from subagents instead of raw intermediate output" — 가공되지 않은 중간 출력물 대신 하위 에이전트로부터 요약본을 반환하십시오.
- 오케스트레이터는 결과들을 종합하여 전체 응답을 구성하고 스레드를 종료합니다.
기본 기술적 제한 사항은 문서에 다음과 같이 명시되어 있습니다:
«
agents.max_threads의 기본값은6이며...agents.max_depth의 기본값은1입니다. 이는 루트 스레드가 직계 자식(direct children)을 생성할 수는 있지만, 해당 자식들이 더 깊은 후손을 생성하는 것은 방지합니다» — 병렬 스레드의 기본 상한은 6이며, 중첩 깊이는 1입니다. 즉, 루트 스레드는 직계 자식을 생성할 수 있지만, 그 자식들은 다시 자신의 자식을 생성할 수 없습니다.
- Codex 문서 (llms-full.txt), 2026년 7월 10일 추출, 영어에서 번역됨.
대량의 유사한 작업을 위한 배치 시나리오인 spawn_agents_on_csv도 있습니다: Codex가 CSV를 읽고, 각 행마다 하나의 서브 에이전트 (sub-agent)를 생성하며, 전체 배치를 기다린 후 통합된 결과를 다시 CSV로 내보냅니다. 목록을 따라 반복적인 작업을 수행할 때 유용합니다.
실제로 몇 명의 에이전트가 사용되는가. 당신은 "기본적으로 4개의 에이전트"라는 말을 들었을 수도 있습니다. 이 수치는 떠도는 이야기이며 주의해서 다뤄야 합니다. Codex의 초기 기술 문서(technical documentation)에는 6개의 스레드 (threads)가 상한선으로 설정되어 있습니다. 반면 "4개"라는 숫자는 OpenAI의 출시 자료를 인용한 매체들에서 언급됩니다:
"Ultra coordinates four agents in parallel by default, trading higher token use for stronger results and faster time-to-result on demanding tasks" - Ultra는 기본적으로 4개의 에이전트를 병렬로 조정하며, 더 강력한 결과와 까다로운 작업에서의 빠른 결과 도출을 위해 더 높은 토큰 사용량을 감수합니다.
- MarkTechPost, 2026년 7월 9일, 영어에서 번역됨.
TestingCatalog와 MarkTechPost (둘 다 2026년 7월 9일)는 "기본값은 4개"라는 점에 동의하지만, 기술 문서 자체에서 "four agents"라는 문구를 문자 그대로 찾아볼 수는 없었습니다. 따라서 다음과 같이 표현하는 것이 정확합니다: Ultra는 기본적으로 여러 에이전트를 실행하며 (언론 보도에 따르면 4개), 설정 가능한 최대치는 6개입니다. 모든 출처에서 일치하는 단일 고정 수치는 존재하지 않습니다.
이제 가장 중요하고 까다로운 질문입니다: 이들은 서로 협력(coordinate)하는 것인가, 아니면 단순히 N개의 병렬 시도(parallel attempts)인가? 이 지점에서 문서와 언론의 설명이 엇갈립니다.
Codex의 공식 문서는 "허브 앤 스포크 (hub and spoke)" 아키텍처를 설명합니다: 오케스트레이터 (orchestrator)가 작업을 배분하면, 서브 에이전트들이 각자의 스레드에서 독립적으로 작업하고 요약본을 반환합니다. 문서에는 에이전트 간의 "그룹 채팅" 같은 개념은 없습니다. 문서에 포함된 예시는 다음과 같이 분업화된 모습을 보여줍니다: 한 서브 에이전트는 버그를 재현하고, 두 번째는 코드를 추적(trace)하며, 세 번째는 원인이 명확해지면 수정합니다. 이 예시에서 에이전트들 사이의 대화는 나타나지 않습니다.
반면 언론과 마케팅 측의 설명은 다른 방식으로 표현됩니다. 즉, 서브 에이전트(sub-agents)들이 "협력하도록 훈련되었으며 작업 중에 서로 통신할 수 있도록 허용되었다(trained to cooperate and allowed to communicate with each other during a task)"라고 말이죠. 듣기에는 아주 좋습니다. 하지만 이 문구는 제가 직접 읽은 Codex의 시스템 카드(System Card)나 기술 문서 어디에도 없습니다. 이 표현은 OpenAI를 인용하며 리뷰들을 떠돌고 있지만, 원문에서 이를 확인하는 데는 실패했습니다.
⚠️ 중요. "오케스트레이터(orchestrator)가 에이전트를 조정한다"와 "에이전트들이 서로 통신한다"를 혼동하지 마십시오. 전자는 문서에 명시되어 있습니다: 중앙 흐름(central flow)이 작업을 배분하고 취합합니다. 후자인 서브 에이전트 간의 피어 투 피어(peer-to-peer) 대화는 1차 자료에서 확인되지 않았습니다. Hacker News의 회의론자들(2026년 7월 6~7일 스레드)은 한 걸음 더 나아가, Ultra가 본질적으로 프롬프트 수준(prompt-level)의 상위 계층, 즉 모델이 선제적으로 서브 에이전트를 호출하도록 지시하는 시스템 프롬프트(system prompt)라고 추측합니다. 그들의 버전에 따르면, 그 이면에 새로운 조정 아키텍처(coordination architecture)는 존재하지 않습니다. 이는 사실이 아닌 의견일 수 있지만, 왜 시스템 카드에서 Ultra에 대해 침묵하는지를 설명해 줍니다.
당신을 위한 실질적인 결론은 간단합니다. Ultra는 실제로 중앙 에이전트의 관리하에 작업을 병렬로 처리하고 결과를 취합합니다. 이는 하위 작업들이 독립적인 경우에 이점을 제공합니다. 하지만 "서로 상의하는 군집(swarm)"이라는 낭만적인 이야기는 반으로 나누어 생각하십시오. 확인된 것은 오케스트레이터를 통한 조정일 뿐, 에이전트 간의 직접적인 통신이 아닙니다.
Ultra는 일반 Codex보다 몇 배나 더 비싼가?
핵심. OpenAI는 공식적인 가격 배수를 공개하지 않았습니다. 이는 리서치의 공백이 아니라 명백한 사실입니다. 회사는 단지 질적으로 "Ultra는 설계상(by design) 토큰 소모를 증가시킨다"라고만 말합니다. 외부 평가들은 크게 엇갈립니다: Hacker News의 논의에 따르면 2
4배, tokenkarma 블로그의 계산에 따르면 612배입니다. 가격표에 "Ultra 모드"에 대한 직접적인 가격은 없습니다. 모델 토큰 비용에 에이전트의 수와 그들의 소모량을 곱한 만큼 지불하게 됩니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기