
반값 모델이 본가를 역전, 43.3% 대 33.7%: Claude Opus 5가 깨뜨린 '상위 모델일수록 똑똑하다'는 상식
요약
Anthropic이 출시한 Claude Opus 5가 기존 플래그십 모델인 Claude Fable 5보다 저렴한 가격에도 불구하고 터미널 코딩 및 OSWorld 2.0 등 주요 벤치마크에서 더 높은 성능을 기록했습니다. 이는 모델의 가격과 지능이 반드시 비례하지 않는 새로운 기술적 패러다임을 보여줍니다.
핵심 포인트
- Opus 5는 Fable 5의 절반 가격으로 터미널 코딩 성능에서 9.6%p 앞섬
- OSWorld 2.0 및 Zapier AutomationBench 등 다수 지표에서 상위 모델 추월
- ARC-AGI-3 및 과학 분야(유기 화학, 단백질 예측)에서도 탁월한 성능 입증
- 비용 효율성과 지능의 역전 현상이 발생하는 새로운 모델 라인업 형성
2026년 7월 24일, Anthropic이 Claude Opus 5를 출시했다. 가격은 입력 $5/출력 $25(100만 토큰당)로, 최상위 모델인 Claude Fable 5($10/$50)의 정확히 절반 가격이다. 그런데 공식 발표된 벤치마크(Benchmark)를 보면, 터미널 코딩(Terminal Coding)의 Frontier-Bench v0.1에서 Opus 5는 43.3%, Fable 5는 33.7%를 기록했다. 반값인 '중위' 모델이 2배 가격의 플래그십(Flagship) 모델을 9.6포인트 앞서고 있다.
컴퓨터 조작 성능을 측정하는 OSWorld 2.0에서도 70.6% 대 66.1%로 Opus 5가 앞선다. 즉, 7월 24일을 기점으로 Anthropic의 라인업은 '비싼 모델일수록 똑똑하다'는 단순한 서열이 성립하지 않게 되었다. 본 기사는 Anthropic의 공식 발표를 1차 소스로 하여, 이러한 역전이 일어난 메커니즘과 가격 및 지능의 관계가 앞으로 어떻게 변할지를 분석한다.
Opus 5는 Claude 5 세대의 세 번째 모델이다. 시계열을 정리하면 다음과 같다.
| 날짜 | 이벤트 |
|---|---|
| 2026년 6월 9일 | Claude Fable 5 출시 ($10/$50, Mythos 클래스의 일반 제공 버전) |
| ... |
7월 초 Cursor에 일시적으로 노출되었던 연구 모델 'Honeycomb'이 Opus 5의 실체였다는 점은, 출시 시기와 동작 양상을 근거로 여러 관측자가 지적하고 있다. 정식 버전은 Claude.ai, Claude Code, Claude Cowork, API를 통해 당일 즉시 이용 가능해졌으며, Claude Max에서는 기본(Default) 모델의 자리를 차지했다.
공식 발표의 서두는 다음과 같이 선언한다.
It's a thoughtful and proactive model that comes close to the frontier intelligence of Claude Fable 5 at half the price.
"절반 가격으로 Fable 5의 프론티어 지능(Frontier Intelligence)에 근접한다". 하지만 실제 벤치마크 표를 보면 '근접'하는 수준을 넘어, 여러 영역에서 추월하고 있다.
공식 발표와 직후의 검증 기사를 바탕으로 주요 수치를 나열한다.
| 벤치마크 | Opus 5 | Fable 5 | Opus 4.8 |
|---|---|---|---|
| Frontier-Bench v0.1 (터미널 코딩) | 43.3% | 33.7% | 21.1% |
| OSWorld 2.0 (컴퓨터 조작) | 70.6% | 66.1% | 55.7% |
| Zapier AutomationBench (업무 워크플로우) | 26.0% | 17.4% | 17.0% |
| ARC-AGI-3 (미지의 문제에 대한 적응) | 30.2% | 공표 없음 | 1.5% |
| 얼라이먼트 감사 스코어 (낮을수록 양호) | 2.30 | 공표 없음 | 2.85 |
덧붙이자면, CursorBench 3.2에서는 Fable 5의 피크 스코어(Peak Score) 0.5% 이내의 성능에 태스크당 절반의 비용으로 도달했다. 과학 분야에서는 유기 화학에서 Opus 4.8 대비 +10.2포인트, 단백질 예측에서 +7.7포인트를 기록했다고 발표되었다.
개별 주장 또한 공식적인 표현을 그대로 인용하면, Frontier-Bench에 대해서는 "모든 모델을 능가하며, Opus 4.8의 성능을 더 낮은 태스크 단가로 2배 이상 높였다", ARC-AGI 3에 대해서는 "차점 모델보다 3배 높은 스코어", OSWorld 2.0에 대해서는 다음과 같이 기술되어 있다.
Opus 5 outperforms every other model at any given cost, surpassing Fable 5's best result at just over a third of the cost.
Fable 5의 베스트 스코어를 약 3분의 1의 비용으로 넘어섰다. 단순한 '저렴한 대체재'가 아니라, 비용을 고정했을 때의 성능에서도 앞선다는 주장이다.
표의 수치는 모두 Anthropic이 직접 공표한 벤치마크 값이다. 출시된 지 불과 이틀밖에 지나지 않았기에, 제3자에 의한 독립적인 검증은 아직 충분히 나오지 않았다. 이 점은 후술할 '한계' 부분에서 자세히 다루겠다.
Opus 5는 Fable 5의 증류(Distillation) 버전이 아니라, Opus 4.8의 계보를 잇는 새로운 학습 이터레이션(Iteration)이다. 이것이 역전의 핵심에 있다. Fable 5의 학습이 완료된 시점은 6월 9일 출시 이전이다. 반면 Opus 5는 7월 24일에 출시되었으며, 에이전트적 태스크에 대한 포스트 트레이닝(Post-training) 레시피는 Fable 5 시점보다 더 최신이다.
즉, 이 역전은 "작은 모델이 큰 모델을 이겼다"는 것이 아니라, 새로운 학습 레시피(Learning Recipe)가 오래된 레시피를, 가격대를 넘나들며 추월했다는 현상이다. 프론티어 모델(Frontier Model)의 우위가 학습 레시피 1세대분, 기간으로 따지면 6주 정도밖에 지속되지 않았음을 의미한다.
공식 발표된 벤치마크 주장은 거의 모두 cost per task(태스크당 비용)와 세트로 작성되어 있다. 에이전트 용도에서는 태스크 하나를 완료하기까지 모델이 수십 번의 도구 호출(Tool Calling)과 재시도(Retry)를 반복한다. 토큰 단가가 절반이라 하더라도, 모델이 방황하여 경로가 2배로 늘어난다면 총비용은 동일해진다.
역으로 말하면, 태스크당 비용에서 승리하기 위해서는 단가의 저렴함에 더해 **짧은 경로로 태스크를 완수하는 행동 품질(Behavior Quality)**이 필요하다. 공식 측에서 "thoughtful and proactive(사려 깊고 선제적인)"라는 표현을 사용하는 것은, 이러한 재시도의 감소를 가리키는 것으로 읽힌다. 얼라이먼트 감사(Alignment Audit) 점수가 Opus 4.8의 2.85에서 2.30으로 개선된 점도, 지시사항으로부터의 이탈이나 과잉 행동이 줄어들어 결과적으로 경로가 짧아지는 방향과 일치한다.
안전성 설계는 Fable 5와 대조적이다. 공식 발표는 다음과 같이 명시한다.
Opus 5 does not advance the frontier in risky, dual-use capabilities... it remains behind Mythos 5 in both biology research and offensive cybersecurity.
Fable 5는 Mythos 5와 동일한 기반 모델(Foundation Model)에 추가적인 세이프가드(Classifier를 통한 개입)를 얹는 방식을 취한다. 반면 Opus 5는 생물학 연구나 공격적 사이버 능력과 같은 듀얼 유즈(Dual-use) 영역의 능력 자체를 프론티어 미만으로 억제하는 방식이다. 그 결과로, 사이버 계열 안전 분류기의 개입 빈도는 Fable 5 대비 약 85% 적어질 것으로 발표되었다. 제3자 검증 기사에서는 사이버 공격 태스크의 성공률이 13문제 중 4문제(Mythos 5는 13문제 중 13문제)라는 구체적인 수치도 보고되었다.
필터로 막는 것이 아니라, 능력의 천장을 낮추어 막는다. 개입으로 인한 오탐(False Positive)이나 작업 중단이 줄어드는 만큼, 일상적인 코딩 용도에서는 "안전하면서도 방해받지 않는" 경험을 제공한다. 안전과 편의성의 트레이드오프(Trade-off)를 필터 계층이 아닌 모델 능력 계층에서 해결하는 접근 방식이다.
Opus 5에는 Fast Mode가 마련되어 있어, 표준 대비 약 2.5배의 속도를 2배의 가격으로 제공한다. 주의할 점은 이것이 작은 모델로의 전환이 아니라, 동일 모델의 고속 서빙(High-speed Serving, 추론 인프라 측의 할당 변경)이라는 점이다.
요금 설계 측면에서 흥미로운 점은 Fast Mode 활성화 시의 가격($10/$50)이 정확히 Fable 5의 표준 가격과 일치한다는 것이다. 동일한 비용으로 "최고 지능의 Fable 5"를 쓸 것인지, "준 프론티어 지능을 2.5배 빠른 속도로 제공하는 Opus 5"를 쓸 것인지 선택하는 구도가 되며, 대화형 코딩처럼 대기 시간이 생산성을 좌우하는 용도에서는 후자가 합리적일 수 있다.
모두 벤더(Vendor) 발표 수치이다. 표의 숫자는 Anthropic 자체 측정값이며, 독립적인 검증은 아직 이루어지지 않았다. Frontier-Bench v0.1은 버전 번호가 나타내듯 새로운 벤치마크이며, 자사 모델에 유리한 과제 선정 여부는 외부에서 확인할 수 없다. 과거 모델 발표에서도 벤더 공표값과 제3자 재현값 사이의 차이는 반복해서 문제가 되어 왔다.
ARC-AGI-3의 30.2%는 "3배"라 해도 절대값은 낮다. 차순위 대비 3배라는 수치는 극적이지만, 70%의 과제는 해결하지 못했다. 미지의 문제에 대한 적응은 여전히 인간과의 격차가 큰 영역이다.
사양 공개가 불완전하다. 공식 발표에는 컨텍스트 윈도우(Context Window) 길이와 최대 출력 토큰 수에 대한 기재가 없다. 일부 보도는 1M 컨텍스트/128k 출력을 전달하고 있으나, 본문 작성 시점에서 공식 문서로 확인된 숫자는 아니다.
전문 특화 영역에서는 Fable 5가 여전히 우위에 있다. 법률·의료 등의 전문 벤치마크에서는 여전히 상위 티어(Tier)가 우세하며, "Opus 5만으로 전부 대체 가능"한 것은 아니다. 또한 Max 플랜의 주간 이용 한도는 이번 출시에서도 변하지 않아, 헤비 유저들의 불만은 남아 있다.
이번 출시가 보여준 구조는 단발적인 역전극보다 더 긴 사정거리를 갖는다.
첫째, 프론티어 가격의 유통기한이 가시화되었다. $10/$50의 프론티어 지능이 6주 후에 $5/$25로 거의 재현되었다. 이 압축 속도가 지속된다면, 최상위 모델의 가격 프리미엄은 "최신 레시피에 대한 선행 접근료"와 동일시될 것이다. 상시적으로 플래그십 모델을 사용할 이유는 희박해지며, 레시피 업데이트의 흐름에 맞춰 가격대를 옮겨 다니는 운용이 표준이 될 것이다.
둘째, 경쟁의 단위가 토큰 단가에서 태스크 단가(task unit price)로 이동한다. 공식 발표가 일관되게 태스크당 비용(cost per task)을 언급한 것은, 에이전트(Agent) 시대의 가격 경쟁이 '1토큰당 얼마'가 아니라 '1태스크 완료당 얼마'로 이루어질 것이라는 선언으로 읽을 수 있다. 이는 모델의 행동 품질(궤적의 짧음, 재시도 횟수의 적음)이 가격 대비 성능비에 직결됨을 의미하며, 벤치마크(Benchmark) 설계 또한 이 방향으로 재편될 것이다.
셋째, 안전 설계가 제품의 차별화 축이 된다. 동일 세대 내에서 필터 개입형인 Fable 5, 능력 상한형인 Opus 5, 제한을 해제한 Mythos 5(승인된 조직 한정)가 나란히 배치되는 구성은, 능력 계층(tier)이 아닌 안전 포스처(safety posture) 계층으로 라인업을 나누는 첫 번째 본격적인 사례다. 규제 당국이 이중 용도(dual-use) 능력 관리를 요구하는 흐름이 강해질수록, '능력의 천장을 제품 사양으로 설계하는' 이 방식은 업계 표준에 가까워질 것이다.
'상위 모델일수록 똑똑하다'는 직관은 2026년 7월 24일에 하나의 반례를 맞이했다. 이제 모델 선정의 판단 기준을 가격표의 상하 관계가 아닌, 태스크 단가와 안전 요구 사항을 중심으로 재구성해야 할 시기가 왔다.
Introducing Claude Opus 5 (Anthropic 공식 발표)
Claude Opus 5 Launch: Benchmarks, Price, Fast Mode (explainx.ai)
Anthropic releases new model, Opus 5 (Axios)
Claude Opus 5 Leaks: Launch Expected on July 20-21, 2026 (AIFOD)
Claude (language model) - Wikipedia
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기