
Claude Opus 5, 에이전트 지식 작업 벤치마크 AA-Briefcase의 새로운 리더로 등극
요약
Anthropic이 출시한 Claude Opus 5가 에이전트 지식 작업 벤치마크인 AA-Briefcase에서 새로운 리더로 등극했습니다. Claude Opus 5는 이전 모델인 Claude Fable 5보다 높은 성능을 기록하면서도 작업당 비용을 20% 절감하는 효율성을 보여주었습니다.
핵심 포인트
- Claude Opus 5가 AA-Briefcase 벤치마크에서 1720 Elo를 기록하며 1위 달성
- Claude Fable 5 대비 작업당 비용을 약 20% 절감하여 비용 효율성 증대
- 분석 품질(analytical quality) 측면에서 압도적인 성능 우위 확보
- 프레젠테이션 품질은 GPT-5.6 Sol 대비 다소 뒤처지는 양상
Claude Opus 5는 당사의 에이전트 지식 작업 (agentic knowledge work) 벤치마크인 AA-Briefcase에서 새로운 리더로 등극했으며, 작업당 비용 (Cost per Task)을 20% 절감하면서 Claude Fable 5를 거의 150 Elo 차이로 앞질렀습니다.
@AnthropicAI가 Artificial Analysis Intelligence Index의 새로운 리더이자, 당사의 독자적인 에이전트 지식 작업 (agentic knowledge work) 벤치마크인 AA-Briefcase에서 1위를 차지한 Claude Opus 5를 출시했습니다. 최대 노력 (max effort) 설정 시, Claude Opus 5는 1720의 AA-Briefcase Elo를 기록하며 Claude Fable 5 (1574)보다 146포인트 앞섰습니다. xhigh (1693) 및 high (1606) 변체(variants) 또한 Fable 5보다 뛰어난 성능을 보이면서도 더 높은 비용 효율성을 제공합니다.
당사는 출시 전 다섯 가지의 모든 노력 (effort) 설정을 벤치마킹했습니다. Claude Opus 5 (max)의 작업당 비용은 $17.79로, Claude Fable 5 ($22.30) 대비 20% 감소했습니다. xhigh 및 high 변체는 더욱 강력한 비용 효율성 트레이드오프 (cost-efficiency tradeoffs)를 제공하며, 두 변체 모두 Fable 5보다 높은 점수를 기록하면서도 각각 64% ($14.26) 및 47% ($10.41) 수준의 비용만 발생합니다.
AA-Briefcase는 에이전트 지식 작업 (agentic knowledge work)을 위한 당사의 독자적인 벤치마크로, 수천 개의 입력 파일에 걸쳐 현실적이고 비공개적인 작업을 수행하며 연구 보고서, 발표 자료, 스프레드시트와 같은 결과물을 요구하는 모델들을 평가합니다. 성능은 정확성 (correctness), 분석 품질 (analytical quality), 그리고 발표 품질 (presentation quality)을 통해 측정되며, 이를 하나의 지표인 AA-Briefcase Elo로 통합합니다.
Claude Opus 5의 5가지 모든 노력 (effort) 설정에 걸친 주요 AA-Briefcase 결과:
➤ 에이전트 지식 작업 (agentic knowledge work)의 명확한 리더: Claude Opus 5의 상위 3가지 노력 (effort) 설정 (max, xhigh, high)이 AA-Briefcase에서 상위 3위를 차지했습니다. Claude Fable 5, Sonnet 5 (max), Opus 4.8 (max)과 더불어, Anthropic은 현재 AA-Briefcase 리더보드 상위 10위권 중 대다수를 점유하고 있습니다. Claude Opus 5는 medium effort에서 1470 Elo를 기록하며 GPT-5.6 Sol (max, 1505) 바로 뒤를 이었으며, low effort에서는 1223 Elo를 기록하며 GLM-5.2 (max, 1254) 바로 아래에 위치했습니다.
➤ 객관적 기준과 분석 품질에서는 선두를 달리고 있으나, 프레젠테이션(presentation)에서는 아님: AA-Briefcase는 객관적 루브릭(rubric) 기준, 분석 품질(analytical quality), 그리고 프레젠테이션 품질(presentation quality) 전반에 걸친 성능을 측정합니다. Claude Opus 5의 성장은 주로 루브릭 통과율(rubric pass rate)과 분석 품질에 의해 주도되었습니다. Max effort 설정에서 Claude Opus 5는 2016의 분석 품질 Elo를 달성하며, Claude Fable 5보다 거의 300 Elo 앞서 나갑니다. Opus 4.8과 비교했을 때, 프레젠테이션 품질은 개선 폭이 더 작으며, 프레젠테이션 Elo는 1628로 여전히 GPT-5.6 Sol (max, 1666)보다 약 40 Elo 뒤처져 있습니다.
➤ Fable 수준의 지식 작업 역량을 절반의 비용으로 제공: Claude Opus 5는 5가지 effort 설정에 걸쳐 광범위한 지능-비용 트레이드오프(intelligence-cost tradeoffs)를 제공합니다. Max effort의 비용은 작업당 $17.79로, 더 높은 AA-Briefcase Elo를 달성하면서도 Claude Fable 5($22.30)보다 약 20% 저렴합니다. 특히, high effort 설정의 Claude Opus 5는 작업당 $10.41의 비용으로 Claude Fable 5보다 32 Elo 높은 성능을 보여주며, 이는 절반 미만의 가격입니다. Claude Opus 5는 Opus 4.8의 가격 정책인 입력/출력 토큰 100만 개당 $5/$25를 유지하며, 캐시 쓰기(cache writes)에는 25%의 프리미엄이, 캐시 히트(cache hits)에는 90%의 할인이 적용됩니다.
➤ 최첨단 성능을 위해 작업당 25분 이상 소요: Claude Opus 5의 상위 3개 effort 설정은 모두 AA-Briefcase 작업당 평균 25분 이상을 소요합니다 (max, xhigh, high 설정에서 각각 36.2분, 34.3분, 25.7분). Max effort의 경우 이는 Opus 4.8(24.1분)보다 약 50% 더 긴 시간이며, 이는 주로 턴(turn) 수의 증가에 기인합니다. Claude Opus 5는 상위 3개 effort 레벨에서 작업당 평균 103, 91, 76회의 턴을 기록한 반면, Opus 4.8 (max)은 55회를 기록했습니다.
[IMG:1]
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: Claude/Anthropic의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기