Claude Opus 5 벤치마크: 수치가 실제로 보여주는 것
요약
Anthropic의 Claude Opus 5 출시와 관련하여, 마케팅적 수치 대신 SWE-bench Pro 등 실제 벤치마크 데이터를 통해 모델의 성능 향상 폭과 비용 효율성을 분석합니다.
핵심 포인트
- Opus 5는 SWE-bench Pro에서 79.2%를 기록하며 이전 모델 대비 10포인트 상승함
- 토큰당 가격 변동 없이 성능이 향상되어 비용 효율성이 개선됨
- 벤치마크 포화 문제로 인해 Verified보다 Pro 지표가 모델 변별력에 더 유용함
- Fable 5와 비교 시 성능 차이는 미미하나 비용은 Opus 5가 훨씬 저렴함
-
Opus 5는 SWE-bench Pro에서 79.2%를 기록하며, 69.2%를 기록한 Opus 4.8 대비 토큰당 가격 변화 없이 10포인트 상승했습니다.
-
Anthropic은 대부분의 성능 향상을 절대 점수보다는 비율(ARC-AGI-3의 3배, Frontier-Bench의 2배 이상)로 발표했습니다.
-
CursorBench 3.2의 최대 노력(max effort) 설정에서, 작업당 비용이 절반임에도 불구하고 Fable 5의 정점과 0.5% 이내의 차이를 보였습니다.
-
공개된 GDPval-AA 수치는 출처에 따라 최대 117 Elo까지 차이가 나므로, 해당 행은 완전히 제외했습니다.
Anthropic은 7월 24일에 Claude Opus 5를 출시했으며, 관련 보도들은 점수 대신 비율로 가득 찼습니다. 차세대 모델보다 3배 높고, 이전 Opus보다 2배 이상 높으며, 비용은 3분의 1을 약간 상회한다는 식입니다. 저는 이러한 문구 뒤에 숨겨진 실제 수치를 찾아보았습니다. 제가 발견한 것은 모델 자체에 대한 정보만큼이나 모델 출시가 어떻게 보고되는지에 대해서도 많은 것을 말해줍니다.
실제로 비교 가능한 수치들
가장 깔끔한 데이터는 SWE-bench Pro입니다. 이는 실제 GitHub 이슈를 대상으로 모델을 실행하고, 패치(patch)가 저장소 자체 테스트를 통과하는지 확인하는 방식입니다. 이는 이전의 SWE-bench Verified 세트보다 더 어려우며, 현재 업계 전체가 인용하는 지표입니다.
| 모델 | SWE-bench Pro | 출시일 |
|---|---|---|
| Claude Fable 5 | 80.3 | 2026-06-09 |
| Claude Opus 5 | 79.2 | 2026-07-24 |
| Claude Opus 4.8 | 69.2 | 2026-05-29 |
| GPT-5.6 Sol | 64.6 | 2026-07-09 |
이는 Opus 4.8에서 Opus 5로 넘어가는 두 달 사이에 10포인트가 상승한 것이며, 토큰당 가격은 변하지 않았습니다 (두 티어 모두 100만 토큰당 5와 25로 실행됨). Fable 5는 1.1포인트의 우위를 유지하고 있지만 비용은 두 배를 청구합니다. 이 두 가지 사실이 결합된 것이 이번 출시의 실제 핵심이며, 둘 중 어느 것도 비율이 아닙니다.
더 오래되고 쉬운 세트인 SWE-bench Verified에서, Opus 5는 5회 테스트 평균 96.0%를 기록했습니다. 평균을 내는 것이 중요합니다. 90% 이상으로 포화된 세트에서의 단일 실행은 모델 간의 격차와 맞먹을 정도로 실행 간 편차가 발생하기 때문에 알려주는 바가 거의 없습니다. 5회 테스트는 대부분의 출시 표가 신경 쓰는 것보다 더 나은 관행이며, 연구소(lab)가 이를 수행할 때는 주목할 가치가 있습니다.
이 두 행이 왜 다르게 작동하는지 정확히 짚고 넘어갈 가치가 있습니다. 왜냐하면 이들은 서로 혼용되어 인용되곤 하지만, 결코 그래서는 안 되기 때문입니다. SWE-bench Verified는 해결 가능함이 확인된 이슈들을 인간이 필터링한 하위 집합(subset)으로, 2024년에는 공정한 테스트였으나 현재는 4개의 모델이 88% 이상의 점수를 기록하고 있어 변별력(discriminator)으로서 거의 무용지물입니다. 벤치마크가 포화(saturate)되면, 남은 점수들은 대부분 불안정한 테스트(flaky tests)나 포맷팅 운(formatting luck)을 측정하게 됩니다. SWE-bench Pro는 더 긴 이슈, 더 큰 리포지토리(repository), 그리고 덜 관대한 채점 방식을 통해 여유 공간(headroom)을 회복하기 위해 구축되었습니다. 연구소(lab)가 Pro 대신 Verified를 앞세운다면, 그 선택 자체가 하나의 정보입니다.
동일한 논리가 제 아카이브에 있는 이전 행들에도 적용됩니다. Opus 4.8은 Verified에서 88.6점, Pro에서 69.2점을 기록했습니다. Opus 4.8과 Opus 5 사이의 Verified 격차는 7.4포인트이며, Pro 격차는 10포인트입니다. 더 어려운 벤치마크에서 더 큰 차이를 보이고 있는데, 이는 개선 사항이 테스트 공간 부족으로 인한 인위적인 결과(artifact)가 아니라 실제적인 것이라면 나타나야 하는 패턴입니다.
생명 과학(life sciences) 수치는 Anthropic이 실제 수치를 제공한 또 다른 지점입니다. Opus 5는 내부 유기 화학(organic chemistry) 벤치마크에서 Opus 4.8보다 10.2%포인트 높고, 단백질(protein) 작업에서는 7.7%포인트 더 높습니다. 두 수치 모두 내부적이며, 특정 기준점(baseline) 대비 포인트 차이(point deltas)로 명시되어 있습니다. 이는 비공개 벤치마크를 발표하는 매우 정직한 방식입니다.
Anthropic이 점수 대신 비율을 발표한 이유
출시 페이지의 대부분은 상대적인 용어로 작성되었습니다. Frontier-Bench v0.1: 작업당 비용은 더 낮으면서 Opus 4.8보다 두 배 이상 높음. ARC-AGI-3: 차순위 모델의 3배. Zapier AutomationBench: 동일한 작업당 비용에서 차순위 모델의 통과율(pass rate)보다 약 1.5배 높음. OSWorld 2.0: Fable 5의 최고 결과보다 약간 높은 비용의 3분의 1 수준으로 압도함. CursorBench 3.2: 작업당 비용은 절반이면서 Fable 5의 정점과 0.5% 이내의 차이.
이 중 어느 것도 부정직한 것은 아닙니다. 다만 모든 것을 확인하기가 어려울 뿐입니다. 기준점(baseline)이 없는 비율은 허위 사실 여부를 가릴 수 없으며, "차순위 모델(the next-best model)"은 다른 누군가가 제품을 출시하는 순간 의미가 변해버리는 움직이는 목표(moving target)입니다. 제3자들은 절대적인 수치(Opus 5의 Frontier-Bench 43.3 대 GPT-5.6 Sol의 34.4, ARC-AGI-3 30.2 대 7.8)로 그 공백을 메웠으며, 이 수치들은 앞서 언급된 비율들과 일치하므로, 이러한 프레이밍은 왜곡(spin)이라기보다는 제시 방식(presentation)에 가까워 보입니다.
그 주장 중 두 가지는 다소 이례적인 방식을 취하고 있어 분석해 볼 가치가 있습니다. Zapier AutomationBench 결과는 "동일한 작업당 비용(at the same cost per task)" 기준, 차순위 모델의 통과율보다 약 1.5배 높다고 인용되었으며, OSWorld 2.0 결과는 Fable 5의 3분의 1이 조금 넘는 비용으로 이를 능가했다고 합니다. 두 방식 모두 가격을 고정하고 성능을 변화시키거나, 성능을 고정하고 가격을 변화시키는 방식을 취합니다. 이는 실제로 비용을 지불하는 사람들에게 원시 점수(raw score)보다 더 유용한 형태이며, 또한 토큰 효율성(token efficiency)이 개선되었을 때만 유리하게 보이는 형태이기도 합니다. 모델은 더 똑똑해졌지만 말이 많아진(chattier) 연구소라면 이 차트를 발표할 수 없을 것입니다.
더 흥미로운 선택은 작업당 비용(cost per task)입니다. Anthropic은 거의 모든 헤드라인 주장의 기준을 점수 단독이 아닌 작업당 비용에 두었습니다. 이는 정당한 지표이며, 에이전트 루프(agent loop) 내에서 모델을 실행하는 누구에게나 리더보드 순위보다 실제로 더 큰 타격을 주는 요소에 가깝습니다. 또한 이는 동일한 정가(sticker price)에서 실행 비용이 저렴해진 모델에게 매우 유리한 지표인데, 결과에 토큰 효율성을 포함시키기 때문입니다. 이 두 가지 사실은 동시에 성립합니다. 저는 이 지표가 없는 것보다는 있는 편이 낫다고 생각하지만, 이를 성능(capability)과 상호 교환 가능한 것으로 취급하지는 않을 것입니다.
변화가 없었던 행들
격차(gaps)는 출시 관련 보도에서 생략되는 부분입니다. 따라서 여기 그 내용을 정리합니다.
일반적인 추론 (General reasoning) 측면에서 현재의 두 프런티어 모델 (Frontier models)은 무승부라고 불러도 될 만큼 충분히 근접해 있습니다. 제3자 집계 데이터에 따르면 GPT-5.6 Sol은 평균 92.5점을 기록한 반면, Opus 5는 90.4점을 기록했습니다. Sol은 또한 DeepSWE 1.1과 HealthBench Professional에서도 우위를 유지하고 있습니다. Sol의 Terminal-Bench 2.1 결과인 91.9% (최상위 모드 기준)는 여전히 지금까지 발표된 수치 중 가장 높은 에이전틱 터미널 (Agentic-terminal) 수치로 남아 있습니다. 만약 귀하의 워크로드 (Workload)가 해당 벤치마크와 유사하다면, 지난 한 주 동안 리더보드 (Leaderboard)는 귀하에게 아무런 변화를 주지 않았을 것입니다.
다음은 인간이 채점하는 지식 노동 벤치마크인 GDPval-AA인데, 여기서는 출처마다 의견이 일치하지 않았습니다. 한 세트의 표에서는 Fable 5를 1,932 Elo로 기록하고 있고, 다른 표에서는 1,815로 기록하고 있습니다. Opus 5를 1,861로 기록한 동일한 표에서 Opus 4.8은 1,890으로 나타나는데, 이는 새 모델이 퇴보했음을 의미하게 됩니다. 서로 다른 벤치마크 버전과 서로 다른 노력 단계 (Effort tiers)가 마치 동일한 열인 것처럼 비교되고 있는 것이 거의 확실합니다. 저는 가장 깔끔한 문단을 만들 수 있는 숫자를 골라낼 수도 있었습니다. 하지만 대신 해당 행을 제외하고 그 이유를 밝히고자 합니다. 출처 간 117점의 불일치는 단순한 반올림 차이가 아니라, 아직 아무도 동일 조건 (Like-for-like)에서의 실행 결과를 발표하지 않았다는 신호이기 때문입니다.
내가 출시 점수판을 읽는 방식
어떤 수치가 의사 결정에 근접하기 전에, 순서대로 다음 네 가지를 확인합니다.
어떤 노력 수준 (Effort level)이 이를 만들어냈는가. Opus 5는 낮음에서 최대까지 5단계로 실행되며, Anthropic 자체의 CursorBench 주장 또한 명시적으로 최대 노력 (Max effort) 결과입니다. 대부분의 제3자 표는 설정을 전혀 명시하지 않는데, 이는 점수가 실제라 할지라도 비용 비교를 위해서는 대략적으로 사용 불가능하게 만듭니다.
얼마나 많은 시행 (Trials)을 거쳤는가. 포화된 벤치마크에서의 단 한 번의 실행은 노이즈 (Noise)입니다. 5회 시행된 SWE-bench Verified 수치는 예외이지, 일반적인 기준이 아닙니다.
누가 실행했는가. 벤더 벤치마크 (Vendor benchmarks)는 모델에 접근 권한이 있고 결과에 이해관계가 있는 사람들이 작성한 마케팅 산물입니다. 그렇다고 해서 그것이 틀렸다는 뜻은 아닙니다. 그것은 하나의 시작 가설 (Starting hypothesis)이 됩니다.
비교 대상 모델이 최신인지 여부. 두 버전 전(two releases ago)에 은퇴한 모델을 이기는 차트는 달력을 측정하고 있는 것과 같습니다. 저는 이와 정확히 동일한 질문에 대해 이전 세대 모델을 다룬 Claude Fable 5 vs Opus 4.8: 가격이 두 배인 만큼의 가치가 있는가를 작성한 바 있으며, 그 비교 내용의 절반은 이미 과거의 데이터가 되었습니다.
핵심 요약 (Bottom Line)
Opus 5의 성적표에 대한 솔직한 요약은 헤드라인보다는 좁은 범위이며, 통상적인 상승폭보다는 더 나은 수준입니다. 즉, 가격 변동 없이 Opus 4.8 대비 SWE-bench Pro에서 10포인트 상승, 두 배의 비용이 드는 모델과 거의 대등한 수준(near-parity), ARC-AGI-3에서의 진정한 아웃라이어 (outlier) 결과, 그리고 OpenAI가 여전히 앞서고 있는 몇몇 항목들로 구성됩니다. 이 비율들은 아마도 정확할 것입니다. 다만 그것들은 단순한 숫자와는 다른 종류의 주장일 뿐입니다.
제가 하지 않을 행동은 이 중 그 어떤 것도 확정된 것으로 취급하는 것입니다. 제가 이 글을 쓰기 전 15일 동안 세 개의 연구소(labs)가 플래그십 모델을 출시했으며, GDPval 열은 출처마다 일관성이 없고, 명시된 노력 수준(effort level)에서 독립적인 동일 조건 비교(like-for-like) 실행 결과를 발표한 곳은 아무도 없습니다. 출시된 내용에 대한 전체 사양 분석은 이 라인의 이전 릴리스인 Claude Opus 4.8 출시: 변경된 모든 것을 참조하시고, 나머지 모델 범위는 Lab overview에 인덱싱되어 있습니다. 저는 몇 주 동안 제 작업에 이 모델들을 직접 적용해 보며 무엇이 실제로 유효했는지 정리할 예정입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기