
Claude Opus 5 등장! 벤치마크 분석·가격·Fable 5 / GPT-5.6와의 철저한 비교
요약
Anthropic의 새로운 플래그십 모델 Claude Opus 5가 출시되었습니다. 상위 모델인 Fable 5 대비 절반 가격임에도 불구하고 코딩 및 지식 작업 벤치마크에서 압도적인 성능을 기록하며, 특히 에이전트로서의 자율적 완수 능력이 크게 향상되었습니다.
핵심 포인트
- Fable 5 대비 절반 가격의 경제적인 가격 정책
- GDPval-AA 및 ARC-AGI-3 벤치마크에서 비약적 성능 향상
- 목표 달성까지 자율적으로 반복하는 Agentic Persistence 구현
- 컴퓨터 비전 및 복잡한 코드 수정 등 실무 에이전트 성능 강화
- 사상 최고 수준의 안전성 및 얼라이먼트 달성
Anthropic사로부터 새로운 플래그십급 모델인 Claude Opus 5가 정식 출시되었습니다.
"프런티어급 지성을 갖추면서도 상위 모델인 Claude Fable 5의 절반 가격"이라는 매우 매력적인 가격 설정(100만 input token당 $5 / 100만 output token당 $25)으로 제공됩니다.
더욱 주목해야 할 점은 단순히 저렴한 가격에 그치지 않고, Frontier-Bench나 GDPval-AA와 같은 코딩 및 지식 작업(Knowledge work) 계열 벤치마크에서 상위 모델인 Fable 5를 능가하는 퍼포먼스를 기록했다는 점입니다.
본 기사에서는 Claude Opus 5의 개요, 각종 벤치마크 결과, 경쟁 모델(GPT-5.6, Gemini 3.6 등)과의 상세한 비교, 그리고 개발자용 신기능에 대해 철저히 해설합니다.
출시일·가격: 2026년 7월 24일 출시. 입력 $5 / 출력 $25 (100만 토큰당). Fable 5의 절반 가격.
GDPval-AA v2에서 1위: 1,861 Elo를 기록하며 Fable 5 (1,747) 및 이전 세대인 Opus 4.8 (1,593)을 크게 앞섬.
ARC-AGI-3에서의 압도적 도약: Opus 4.8의 1.5%에서 **30.2%**로 약 20배 대폭 향상.
최고의 안전성·얼라이먼트 (Alignment): 일탈 행동 (Misaligned-behavior) 감사 스코어에서 2.3을 기록하며 사상 최고의 안전성을 달성.
실무에 강한 에이전트 성능: 단순히 그럴듯한 답변을 내놓는 것에 그치지 않고, 목표 달성까지 자율적으로 시행착오를 반복하는 끈기 (Agentic Persistence)를 구현.
Opus 5는 Anthropic의 모델 포트폴리오에서 Mythos 5 다음의 위치(Sonnet이나 Haiku의 상위)를 차지하는 모델입니다.
Anthropic은 본 모델을 "사려 깊고 능동적 (Thoughtful and Proactive)"이라고 표현하며, AI 엔지니어나 일상적인 자동화 태스크에서 상시 가동하는 에이전트로서의 이용을 상정하고 있습니다.
특히 코딩이나 지식 노동 평가(Frontier-Bench, GDPval-AA 등)에 있어서는 사이버 보안 전용 태스크를 제외하고 Anthropic이 제공하는 이용 가능한 모델 중 최고봉의 성능을 보여줍니다.
Opus 5의 진화에서 특히 현저한 것이 **"태스크 완수를 향한 끈기 (Agentic Persistence)"**와 **"비주얼 출력 정밀도 향상"**입니다.
기존 모델은 언뜻 정답처럼 보이는 답변을 출력한 단계에서 처리를 종료해 버리는 경향이 있었습니다. 하지만 Opus 5는 과제가 해결될 때까지 자율적으로 루프와 검증을 반복하는 자세가 대폭 강화되었습니다.
케이스 스터디 1 (컴퓨터 비전):
CAD 등의 설계도를 직접 열람하는 툴이 없는 환경에서, Opus 5는 생(raw) 픽셀 데이터로부터 기하학적 구조를 추출하는 컴퓨터 비전 파이프라인을 스스로 코딩하여 해결했습니다.
케이스 스터디 2 (오픈 소스 버그 수정):
인기 패키지 매니저의 기존 버그 수정 요청에 대해, 표면적인 패치를 적용하는 것이 아니라 근본 원인 (Root Cause)을 특정하여 수정을 완료했습니다.
케이스 스터디 3 (금융 데이터 파이프라인):
거래 기업의 엔지니어가 Opus 5를 사용하여, 신규 거래소용 시장 데이터 파이프라인과 로직 검증용 테스트 하네스(Test harness)를 1개 세션 내에 구축 완료했습니다.
풍동 (Wind-tunnel) 시뮬레이션과 같은 유체 역학이나 공기 역학 유선(Aerodynamic streamline)의 시각화 코드·다이어그램 생성 능력이 격상되었습니다. 설계도나 아키텍처 도, 각종 차트 생성 태스크에서 높은 표현력을 발휘합니다.
Opus 5와 Anthropic의 역대 및 현행 모델과의 비교는 다음과 같습니다.
| 벤치마크 | Haiku 4.5 | Sonnet 4.6 | Opus 4.7 | Opus 4.8 | Sonnet 5 | Fable 5 | Claude Opus 5 |
|---|---|---|---|---|---|---|---|
| SWE-bench Verified | 73.3% | 79.6% | 87.6% | 88.6% | — | 95.0% | 96.0% |
| SWE-bench Pro | — | 58.1% | 64.3% | 69.2% | 63.2% | 80.3% | 79.2% |
| Terminal-Bench 2.1 | 41.0% | 67.0% | 69.4% (2.0) | 74.6% | 80.4% | 88.0% | 미공개 |
| Frontier-Bench v0.1 | — | — | — | 18.7% | — | 33.7% | 43.3% |
| GDPval-AA v2 (Elo) | — | — | 1,753 (v1) | 1,593 (v2) | 1,618 (v2) | 1,747 (v2) | 1,861 (v2) |
| 편향 행동 감사 점수 (낮을수록 좋음) | — | — | — | 미공개 | 미공개 | 미공개 | 2.3 (역대 최고) |
| 가격 (USD / 1M token in/out) | $1 / $5 | $3 / $15 | $5 / $25 | $5 / $25 | $2-3 / $10-15 | $10 / $50 | $5 / $25 |
- Fable 5 대비: 가격이 Fable 5($10/$50)의 **절반($5/$25)**이면서도, Frontier-Bench v0.1(43.3% vs 33.7%)나 GDPval-AA v2(1,861 vs 1,747)에서 Fable 5를 명확히 능가합니다. -
Opus 4.8 대비: 불과 2개월 전에 출시된 Opus 4.8과 비교해도, ARC-AGI-3에서 1.5% → 30.2%, **Frontier-Bench에서 18.7% → 43.3%**로 차원이 다른 세대 간 도약을 이루었습니다.
주요 AI 연구소(Anthropic, OpenAI, Google)의 공식 발표 수치를 기반으로 한 비교 목록입니다.
| 카테고리 | 벤치마크 | Claude Opus 5 | GPT-5.6 Sol | GPT-5.6 Sol Ultra | GPT-5.6 Terra | GPT-5.6 Luna | GPT-5.5 | Gemini 3.6 Flash | Gemini 3.5 Flash-Lite | Gemini 3.5 Flash | Gemini 3.1 Pro Preview |
|---|---|---|---|---|---|---|---|---|---|---|
나레지 | GDPval-AA v2 (Elo) | 1861 | 1736 | — | 1593 | 1591.8 | 1493.7 | 1421 | — | 1348.8 | 962.3 |
Coding | SWE-Bench Pro | 79.2% | 64.6% | — | 63.4% | 62.7% | 59.4% | — | 54.2% | — | 54.2% |
Coding | DeepSWE v1.1 | 68.8% | 72.7% | — | 69.6% | 67.2% | 67.0% | 49.0% | — | 37.0% | 11.8% |
Coding | Terminal-Bench 2.1 | — | 88.8% | 91.9% | 87.4% | 84.7% | 85.6% | — | 54.0% | — | 70.7% |
Coding | Frontier-Bench v0.1 | 43.3% | — | 37.5% | — | — | — | — | — | — | — |
Computer Use | BrowseComp | 90.8% | 90.4% | 92.2% | 87.5% | 83.3% | 84.4% | — | — | — | 85.9% |
Computer Use | OSWorld 2.0 | 70.6% | 62.6% | — | 50.2% | 45.6% | 47.5% | — | — | — | — |
추상 추론 | ARC-AGI-3 | 30.2% | 7.78% | — | 0.8% | 0.18% | 0.43% | — | — | — | 0.42% |
도구 이용 | AutomationBench | 26.0% | 18.1% | — | 15.2% | 14.9% | 12.9% | — | — | 14.5% | — |
⚠️
참고: 각 수치는 각 AI 연구소가 자체적으로 발표한 평가 하네스나 프롬프트 설정에 기반한 측정값입니다. 상대적인 경향을 보여주는 참고 지표로 활용해 주십시오.
vs GPT-5.6 Sol:
Opus 5의 강점: 추상적 사고 및 미지의 작업(ARC-AGI-3, Frontier-Bench, AutomationBench, OSWorld 2.0)에서 크게 앞섭니다. 개방형 문제 해결에 뛰어납니다.
GPT-5.6 Sol의 강점: 장기적인 코딩 작업(DeepSWE v1.1)이나 특정 터미널 조작에서 우세합니다.
vs Gemini 3.6 Flash:
최근의 Gemini는 Flash 계열의 비용 효율 모델에 주력하고 있기 때문에, 플래그십급인 Opus 5와 직접적인 경쟁 관계가 아닙니다.
모델 식별자 (Model String): claude-opus-5
표준 요금: 입력 $5.00/ 100만 토큰, 출력 $25.00/ 100만 토큰 -
Fast Mode: 일반 속도의 약 2.5배로 작동하는 고속 모드 (API 요금은 기본의 2배).
Claude Platform에서는 세션 도중에 사용할 수 있는 도구 정의를 변경할 수 있게 되었습니다. 중요한 점은, 도구 정의를 변경해도 프롬프트 캐시(Prompt Cache)가 무효화되지 않는다는 것입니다. 긴 길이의 컨텍스트를 유지한 채 유연한 멀티스텝 워크플로우를 구축할 수 있습니다.
Opus 5나 Fable 5의 안전성 분류기(safety classifier)에 의해 플래그가 지정된 요청에 대해, 오류로 완전히 차단하는 대신 이용 가능한 다른 모델로 자동 리레이 처리(라우팅)를 수행하는 기능이 도입되었습니다. API 트래픽의 가용성이 크게 향상됩니다.
Anthropic은 모델 성능의 향상과 가격 파괴를 동시에 추진하고 있습니다. 이번에 출시된 Claude Opus 5는 상위 모델인 Fable 5의 절반 가격임에도 불구하고, 실제 고도화된 코딩이나 자율 에이전트형 (Agentic) 태스크에서 이를 능가하는 성과를 입증했습니다.
특히 ARC-AGI-3에서의 30.2% 달성이나 **에이전트적 끈기 (Agentic Persistence)**는 향후 AI 애플리케이션 개발에 있어 큰 패러다임 전환을 가져올 것으로 생각됩니다.
본 기사는 AI 업계의 최신 동향을 바탕으로 작성되었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기