Claude Opus 5, 에이전트적 업무(agentic work)에서 선두를 달리고 Fable 5보다 저렴한 비용 실현
요약
Anthropic의 Claude Opus 5가 출시되어 에이전트적 업무 성능에서 Fable 5와 GPT-5.6 Sol을 앞서는 벤치마크 결과를 기록했습니다. 높은 지능을 유지하면서도 작업당 비용을 기존 모델 대비 낮추어 에이전트 워크로드의 효율성을 극대화했습니다.
핵심 포인트
- 에이전트 지식 업무 및 코딩 분야에서 최상위 벤치마크 기록
- Fable 5 대비 약 26% 저렴한 작업당 비용 실현
- 1M 토큰 컨텍스트 윈도우 및 5단계 노력 설정 지원
- 사실적 지식 및 환각률 측면에서는 Fable 5 대비 주의 필요
Claude Opus 5가 출시되었으며, Anthropic의 출시 전 평가를 지원했던 Artificial Analysis가 방금 전체 벤치마크 분석 결과를 발표했습니다. 핵심 내용은 다음과 같습니다: 에이전트적 지식 업무(agentic knowledge work)를 위한 새로운 최상위 모델이자, Fable 5보다 작업당 비용이 더 저렴합니다.
프런티어(frontier) 모델 시장에서 이러한 조합은 흔치 않습니다.
"Opus 5 (max)는 Artificial Analysis Intelligence Index에서 61점을 기록하여, Claude Fable 5 (max, 60)와 사실상 동등하며, GPT-5.6 Sol (max, 59)를 앞섭니다."
실제로 무엇이 바뀌었나
- 새로운 에이전트 리더: GDPval-AA v2에서 1861 Elo를 기록하며, Fable 5와 GPT-5.6 Sol 모두보다 100점 이상 앞서 있습니다. AA-Briefcase (에이전트적 지식 업무)에서는 Fable 5보다 146 Elo 높습니다.
- 코딩 분야 공동 1위: Claude Code를 사용하는 Opus 5 (xhigh)가 SWE-Atlas-QnA에서 최고 점수를 포함하여 Artificial Analysis Coding Index에서 1위를 차지했습니다.
- Terminal-Bench v2.1에서 89% 기록: 현재 터미널 분야 리더인 GPT-5.6 Sol과 거의 유사한 수준입니다.
- 작업당 비용: 최대 노력(max effort) 기준 $2.03로, Fable 5의 $2.75와 비교됩니다. 이는 에이전트 벤치마크에서 동등하거나 더 나은 지능을 제공하면서도 26% 더 저렴함을 의미합니다.
- 1M 토큰 컨텍스트 윈도우 (context window) (Opus 4.8과 동일), 5단계 노력 설정 (low → max), 그리고 서버 측 폴백(fallback) 지원.
- 가격: 입력/출력 토큰 100만 개당 $5/$25 — 이전 Opus 출시 때와 동일한 요율입니다.
비용-지능의 변화
현재 대부분의 팀이 실제로 구축하고 있는 에이전트 워크로드(agentic workloads)에 대해, Opus 5는 단순히 Fable 5와 대등한 수준이 아닙니다. 이를 능가할 뿐만 아니라, 더 적은 비용을 청구합니다.
Fable 5가 "더 많은 자원을 투입하는" 옵션이었다면, Opus 5는 트레이드오프(trade-off)를 재정의합니다. 즉, 더 나은 에이전트적 결과와 더 낮은 비용을 동시에 제공합니다. 중간 단계의 노력 설정(high, xhigh)에서 Opus 5는 작업당 비용 기준으로 Opus 4.8과 Sonnet 5를 모두 능가할 수 있습니다. 이는 최대 노력(max effort) 단계에 도달하기 전에도 활용할 수 있는 여유 공간이 매우 크다는 것을 의미합니다.
주의해야 할 점은 다음과 같습니다: 사실적 지식(factual knowledge)은 여전히 뒤처져 있습니다. Opus 5는 Opus 4.8 대비 AA-Omniscience에서 7포인트 향상되었으나, 환각률(hallucination rate)은 14포인트 상승하여 50%에 달했습니다. 즉, 불확실할 때 더 자신 있게 추측한다는 의미입니다. 검색 중심(retrieval-heavy) 작업이나 사실적 정밀도가 요구되는 작업에서는 여전히 Fable 5가 우위를 점하고 있습니다.
실행 지침 (What to do)
- 에이전트적 파이프라인(agentic pipelines)을 운영 중인가요? Opus 5가 벤치마크의 새로운 기본값(default)입니다.
max노력을 투입하기 전에high또는xhigh노력 단계부터 시작하십시오. - Claude Code를 사용 중인가요? 이미 혜택을 누리고 계십니다 — 코딩 에이전트 인덱스(Coding Agent Index)에서 공동 1위를 차지했습니다.
- 프런티어 모델(frontier models)의 비용에 민감한가요? 최대 노력(max-effort)을 투입한 Opus 5는 Fable 5보다 26% 저렴합니다. 비용 모델을 다시 실행해 보십시오 — 이는 계산 방식을 바꿀 것입니다.
- 사실적 지식 작업인가요? 보류하십시오. 50%의 환각률은 지식 집약적인 모든 작업에 있어 엄격한 한계치입니다. 그 분야에서는 여전히 Fable 5가 승리합니다.
전체 벤치마크 분석: Artificial Analysis — Claude Opus 5
✏️ KewBot (AI)가 초안을 작성하고, Drew가 편집 및 승인함.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기