Claude Opus 5: Anthropic, Fable 5의 절반 가격으로 성능 구현
요약
Anthropic이 기존 Fable 5의 절반 가격으로 유사한 성능을 구현한 Claude Opus 5를 출시했습니다. Opus 5는 이전 모델인 Opus 4.8 대비 벤치마크 점수를 두 배 이상 높였으며, 코드 및 지식 작업에서 최첨단 성능을 보여줍니다.
핵심 포인트
- Claude Fable 5 수준의 지능을 절반의 비용으로 제공
- Frontier-Bench v0.1에서 Opus 4.8 대비 성능 2배 향상
- Claude Max의 기본 모델 및 Claude Pro의 최강 모델로 적용
- 코드, 지식 작업, 컴퓨터 사용 분야에서 SOTA 달성
- 사이버 보안 분야에서는 특화 모델인 Mythos 5에 뒤처짐
Anthropic은 자사 모델의 가격과 성능의 한계를 높였습니다: Claude Opus 5가 출시되었으며, 회사 측에 따르면 작업당 비용을 절반만 지불하면서도 Claude Fable 5의 프런티어 지능(frontier intelligence)에 근접합니다. 이 발표는 2026년 7월 24일에 이루어졌으며, Opus 5는 Claude Max의 기본 모델이자 Claude Pro에서 사용할 수 있는 가장 강력한 모델이 되었습니다.
이 도약은 단순히 가격에만 국한되지 않습니다. Anthropic이 내부적으로 사용하는 소프트웨어 엔지니어링 평가 도구인 Frontier-Bench v0.1에서, Opus 5는 이전 모델인 Opus 4.8의 점수를 두 배 이상 높였으며, 더 낮은 작업당 비용으로 해당 테스트에서 평가된 모든 모델을 능가합니다.
요약 (TL;DR)
- Anthropic은 2026년 7월 24일에 Claude Opus 5를 출시했으며, 모든 플랜에서 즉시 사용할 수 있습니다.
- 주요 벤치마크에서 Claude Fable 5의 성능에 근접하지만, 작업당 비용은 절반입니다.
- 이제 Claude Max의 기본 모델이며, Claude Pro에서 사용 가능한 가장 강력한 모델입니다.
- Frontier-Bench v0.1에서 이전 모델인 Opus 4.8의 점수를 두 배 이상 높이면서도 비용은 더 낮습니다.
- ARC-AGI 3에서 평가된 두 번째로 우수한 모델보다 3배 더 높은 점수를 얻었습니다.
- OSWorld 2.0에서 Fable 5의 최고 결과보다 더 나은 성능을 보이면서도 비용은 3분의 1을 약간 상회하는 수준입니다.
- 유기 화학 작업에서 Opus 4.8 대비 최대 10.2%포인트 개선되었습니다.
- Anthropic의 인정에 따르면, 사이버 보안 평가에서는 Claude Mythos 5에 뒤처집니다.
서론
Anthropic의 각 새로운 모델은 서로 다른 질문에 답합니다. Fable 5는 비용을 크게 고려하지 않고 순수한 지능을 목표로 했습니다. Mythos 5는 사이버 보안에 맞춰 미세 조정되었습니다. Claude Opus 5는 더 실용적인 질문에 답합니다: 비용이 급증하지 않으면서도, 실제 업무를 위해 매일 사용하는 모델에 얼마나 많은 프런티어 지능을 담을 수 있는가 하는 점입니다.
Anthropic의 답변은 Opus 5가 직전 모델인 Opus 4.8과 동일한 비용을 유지하면서도, 코드 (Code), 지식 작업 (Knowledge work), 컴퓨터 사용 (Computer use) 평가에서 실질적으로 개선되었다는 것입니다. 회사의 표현을 빌리자면, 이는 일상적인 사용을 위해 설계된, 사려 깊고 능동적인 (proactive) 모델입니다.
발생한 일
2026년 7월 24일, Anthropic은 Claude Opus 5를 공식 발표하고 구독 플랜과 API를 통해 즉시 사용할 수 있도록 출시했습니다. 이번 출시와 함께 두 가지 제품 변화가 동반되었습니다: Opus 5는 가장 높은 사용량을 가진 구독 플랜인 Claude Max의 기본 모델이 되었으며, Claude Pro 내에서 사용할 수 있는 가장 강력한 모델이 되었습니다.
Anthropic은 Opus 5를 Frontier-Bench 및 GDPval-AA와 같은 코드 및 지식 작업 평가에서 새로운 SOTA (State of the Art, 최첨단)로 자리매김했습니다. 회사 스스로 인정하는 유일한 예외 사항은 사이버 보안 (Cybersecurity) 작업에서 Opus 5가 해당 도메인에 특화되어 미세 조정된 (fine-tuned) 모델인 Claude Mythos 5보다 뒤처진다는 점입니다.
Opus 5는 이미 Claude Max 계정의 기본 모델로 적용되었습니다.
배경 및 역사
Opus 5는 Opus 4.8의 직계 후속작으로 등장했으며, 이미 가장 높은 원시 지능 (Brute intelligence)을 가진 모델인 Fable 5와 사이버 보안 특화 모델인 Mythos 5를 포함하고 있는 제품군에 합류했습니다. Opus 라인업에 대한 Anthropic의 전략은 항상 Fable과는 달랐습니다. 비용에 상관없이 가능한 최대 점수를 쫓는 대신, Opus는 지속적인 프로덕션 (Production) 환경에서의 사용을 위해 비용 대비 성능 (Cost-performance) 곡선 상의 최적의 지점을 찾는 것을 목표로 합니다.
이러한 논리는 Anthropic이 Opus 5를 측정하는 방식에서도 나타납니다. 단순히 최고 점수뿐만 아니라, 각 노력 (Effort) 수준별 점수를 측정합니다. Claude 모델은 사용자가 지능을 우선시할지 아니면 토큰 (Tokens)과 응답 시간 (Response time)을 절약할지를 결정할 수 있도록 노력 수준을 low, high, xhigh, max 사이에서 조정할 수 있게 합니다. Opus 5는 가장 비용이 많이 드는 극단적인 지점뿐만 아니라 이 곡선 전체에서 성능을 개선했습니다.
코드 및 에이전트 (Agents)
Frontier-Bench v0.1에서 Opus 5는 평가된 다른 모든 모델을 능가하며, 더 낮은 작업당 비용으로 Opus 4.8의 성능을 두 배 이상 향상시켰습니다. CursorBench 3.2에서 최대 노력(effort)을 투입했을 때, Opus 5는 Fable 5의 최고 점수와 0.5%포인트 차이밖에 나지 않으면서도 작업당 비용은 절반 수준을 기록했습니다. 또한 high, xhigh, max 노력 수준에서 평가된 그 어떤 모델보다 더 나은 비용 대비 성능을 달성했습니다.
Devin의 보고에 따르면, FrontierCode 1.1에서 Claude Opus 5는 절반의 비용으로 Fable 5의 수준에 근접하며, 특히 어려운 디버깅 (debugging) 및 근본 원인 분석 (root cause analysis)에서 강력한 강점을 보입니다. Cursor의 의견도 일치합니다. CursorBench에서 Opus 5는 Fable 5에 근접한 성능을 보이며, Opus의 속도와 비용으로 Fable 5의 행동 양식 상당 부분을 재현합니다.
Anthropic이 강조하는 한 가지 사례는 다음과 같습니다. Opus 5에게 기계 부품의 도면을 주고, 도면을 직접 볼 수 있는 형태를 제공하지 않은 채 코드를 통해 FreeCAD에서 3D 모델로 재구성하도록 요청했습니다. 이 모델은 원시 픽셀 (raw pixels)에서 기하학적 구조를 추출하기 위해 자체적인 컴퓨터 비전 (computer vision) 파이프라인을 작성하였고, 전체 부품을 반복 가능한 방식으로 완벽하게 재구성했습니다. 동일한 설정에서 경쟁 모델 중 그 어떤 모델도 다섯 번의 시도 내에 이 과제를 해결하지 못했습니다.
과학 및 추론 (Science and reasoning)
새로운 문제 해결 능력을 측정하기 위해 설계된 평가인 ARC-AGI 3에서, Opus 5의 점수는 차점자 모델보다 3배 높습니다. 모델이 비즈니스 태스크를 처음부터 끝까지 완료하는지 측정하는 Zapier AutomationBench에서, Opus 5는 동일한 작업당 비용으로 차점자 모델보다 약 1.5배 더 많은 태스크를 통과했습니다. 심지어 가장 낮은 노력 수준에서도 평가된 다른 어떤 모델보다 더 많은 태스크를 통과했습니다.
컴퓨터 사용 벤치마크인 OSWorld 2.0에서 Opus 5는 모든 비용 수준에서 다른 어떤 모델보다 뛰어난 성능을 보였으며, Fable 5 비용의 3분의 1을 조금 넘는 비용만으로 Fable 5의 최고 기록을 경신했습니다(https://www.anthropic.com/news/claude-opus-5). Anthropic은 또한 이 모델이 GDPval-AA v2, HLE, AutomationBench 및 DeepSearchQA에서 가장 강력하고 비용 효율적인 모델이라고 강조합니다.
과학 연구를 위해, Opus 5는 구조 생물학, 유기 화학 및 생물 정보학(Bioinformatics)을 아우르는 Anthropic의 모든 생명 과학 평가에서 Opus 4.8보다 향상된 성능을 보여줍니다. 가장 눈에 띄는 개선은 유기 화학 분야에서 나타납니다. 분광학(Spectroscopy) 데이터로부터 분자 구조를 추론할 때 Opus 4.8보다 10.2%포인트 더 높은 성능을 기록했습니다. 서열의 변이가 기능에 미치는 영향을 예측하는 것과 같은 단백질 작업에서는 7.7%포인트의 개선을 보였습니다.
검증 및 에이전트적 작업 (Agentic work)
Anthropic은 Opus 5의 핵심적인 개선 사항이 단순히 점수뿐만이 아니라고 강조합니다. 그것은 자신의 작업을 검증하고 정확한 결과에 도달할 때까지 신중하게 반복(Iterate)하는 능력입니다. 한 트레이딩 회사의 엔지니어는 Opus 5를 사용하여 단 한 번의 세션 만에 새로운 거래소(Exchange)를 위한 시장 데이터 피드(Market data feed)를 구축했습니다. 이전 모델들은 사전에 준비된 광범한 계획이 있더라도 이 작업을 완료하지 못했습니다. 검증할 수 있는 라이브 피드가 없는 상황에서, Opus 5는 자신의 코드가 거래소 데이터를 올바르게 해석하는지 확인하기 위해 자체적인 테스트 하네스(Test harness)를 구축했습니다.
인기 있는 오픈 소스 패키지 관리자의 실제 버그 사례에서, Opus 5는 근본 원인(Root cause)을 찾아냈고 커뮤니티 패치가 간과했던 엣지 케이스(Edge case)를 수정했습니다. 경쟁 모델은 동일한 버그에 직면했을 때 표면적인 증상만을 수정하고 문제를 해결된 것으로 보고했습니다.
💡 팁: 노력 수준 (effort level)은 Opus 5에서 비용을 제어하는 가장 중요한 다이얼입니다. low 설정에서도 이미 AutomationBench에서 다른 모델들을 능가하므로, high나 max로 올리기 전에 거기서 먼저 테스트해보는 것이 좋습니다.
테스트 방법
Claude Opus 5는 추가 단계 없이 Claude Max 및 Claude Pro에서 이미 활성화되어 있습니다. 해당 구독 중 하나를 사용하고 있다면, 앱이나 웹의 모델 선택기에서 기본 옵션 또는 사용 가능한 옵션으로 이미 표시될 것입니다. API로 통합하려면 최근의 다른 Claude 모델과 동일한 흐름을 따르되, 모델 식별자(model identifier)만 변경하면 됩니다.
curl을 사용한 최소한의 API 호출 예시 (Windows의 PowerShell, macOS, Linux에서 동일하게 작동합니다):
curl https://api.anthropic.com/v1/messages \
-H "content-type: application/json" \
-H "x-api-key: $ANTHROPIC_API_KEY" \
...
이 호출은 model 필드가 포함된 JSON을 반환합니다. 특히 코드가 여전히 이전 모델을 기본값으로 가리키고 있는 경우, 해당 필드에 Opus 4.8 식별자가 아닌 claude-opus-5라고 적혀 있는지 확인하십시오.
Pull Request(PR) 검토나 프로덕션 코드 디버깅과 같은 실제 에이전트적 작업(agentic work)을 위해서는 SDK를 사용하고 케이스에 따라 노력 수준 (effort level)을 조정하는 것이 좋습니다:
import anthropic
client = anthropic.Anthropic()
...
effort를 low 또는 medium으로 설정하면 비용이 낮아지지만, Devin이 Opus 5의 가장 큰 강점이라고 보고한 심층 디버깅 작업의 경우, high에서 시작하여 결과가 충분하지 않을 때만 xhigh 또는 max로 올리는 것이 바람직합니다:
flowchart TD
A["Opus 5로 해결할 작업"] --> B["Effort: low"]
B --> C{"결과가 충분한가?"}
...
영향 및 분석
영향 및 분석
Anthropic이 Opus 5를 통해 전달하는 메시지는 프론티어 (Frontier)급 지능이 더 이상 프론티어급 가격을 요구하지 않는다는 것입니다. 다음 표는 Anthropic의 자체 보고를 바탕으로 해당 제품군 내 각 모델의 위치를 요약한 것입니다:
| 모델 | 강점 | 상대적 비용 | 한계 |
|---|---|---|---|
| Claude Opus 5 | Frontier-Bench 및 GDPval-AAI의 새로운 SOTA (State-of-the-Art) | Opus 4.8과 동일 | 사이버 보안 측면에서 Mythos 5에 뒤처짐 |
| Claude Opus 4.8 | 직접적인 이전 모델, 비교 기준 | 기준점 (1x) | Opus 5에 의해 Frontier-Bench 점수가 두 배로 증가함 |
| Claude Fable 5 | 프론티어 (Frontier) 지능, 제품군의 정점 | 작업당 가장 높음 (OSWorld 2.0에서 최대 ~3배) | 작업당 비용이 훨씬 높음 |
| Claude Mythos 5 | 사이버 보안 작업에 특화됨 | Anthropic에서 명시하지 않음 | 일반적인 일상적 사용을 위해 설계되지 않음 |
이미 비즈니스 워크플로우에 Claude를 통합하고 있는 기업들에게 Zapier의 사례가 가장 구체적입니다: Opus 5는 이전 Claude 모델들보다 더 많은 토큰을 소비하지 않고도 AutomationBench 리더보드 1위를 차지했습니다. Opus 5는 가공되지 않은 계정 상태 스프레드시트를 가져와 이탈 방지를 위한 전체 시퀀스를 실행했습니다: 위험 계정을 표시하고, 각 계정의 적절한 담당자에게 알림을 보냈으며, 리텐션 (Retention) 팀을 위해 모든 내용을 요약했습니다. 이전 모델들은 이 작업을 통과하지 못했지만, Opus 5는 100% 달성했습니다.
Claude 모델을 기반으로 제품을 구축하는 Lovable은 Opus 5가 Lovable의 내부 평가에서 해당 제품군의 모든 이전 모델을 앞질렀다고 보고했습니다. 구체적으로 가장 어려운 에이전틱 코딩 (Agentic Coding) 작업에서 Opus 4.7 대비 22%의 성능 향상을 보였으며, 특히 그들이 강조하는 점은 실행 간의 분산 (Variance)이 줄어들었다는 것입니다.
📌 참고: Anthropic은 Opus 5가 모든 분야에서 가장 강력한 모델은 아니라고 명시했습니다. 사이버 보안 (Cybersecurity) 분야에서는 Mythos 5가 여전히 앞서 있습니다. 모델을 선택할 때 단순히 이름이나 출시일이 아니라, 도메인 (Domain)에 따라 선택하는 것이 여전히 올바른 결정입니다.
Opus 5는 이 풍동 (Wind tunnel)과 같이 복잡한 시각적 출력 (Visual outputs)을 생성하는 능력도 향상되었습니다.
Anthropic은 또한 Opus 5가 생성한 두 가지 시각적 출력 예시를 보여주었습니다: 공기역학적 (Aerodynamic) 및 비공기역학적 (Non-aerodynamic) 물체 위로 흐르는 공기의 흐름을 시각화하는 상호작용형 풍동 시뮬레이션과, 단순화된 세포의 상호작용형 일러스트레이션입니다. 이는 정량화된 벤치마크 (Benchmark)가 아닌 제품 예시이지만, 개선 사항이 코드와 텍스트에만 국한되지 않음을 보여줍니다.
향후 전망
Anthropic은 Opus 라인업의 다음 모델에 대한 날짜를 발표하지 않았지만, 이 회사의 출시 패턴 (Opus 4.8, 그리고 현재의 Opus 5와 형제 모델인 특화 모델 Fable 5 및 Mythos 5)을 보면 서로 다른 역할(최대 지능, 사이버 보안, 비용 효율적인 일상적 사용)을 가진 세 가지 패밀리를 유지하는 전략을 고수하고 있음을 시사합니다. 단기적으로는 Devin, Cursor, Lovable과 같이 이미 Claude를 통합하고 있는 더 많은 플랫폼들이 기본 모델을 Opus 5로 전환하고 자체적인 수치를 발표할 가능성이 높으며, 이는 발표 당일 이미 시작되었습니다.
📖 Telegram 요약: 요약 보기
직접 테스트해보세요: 이미 Anthropic API 키를 가지고 있다면, 마지막 호출의 model을 claude-opus-5로 변경하고 응답의 model 필드를 이전 버전과 비교해 보세요.
자주 묻는 질문 (FAQ)
Claude Opus 5란 무엇인가요?
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기