
Claude Opus 5 출시: 절반 가격으로 만나는 프론티어급 코딩 성능
요약
Anthropic이 기존 모델 대비 절반의 가격으로 프론티어급 성능을 제공하는 Claude Opus 5를 출시했습니다. 이 모델은 코딩 및 에이전트 벤치마크에서 최첨단 성능을 기록하며 비용 효율성을 극대화했습니다.
핵심 포인트
- Fable 5에 근접하는 지능을 절반 가격으로 제공
- 코딩 및 에이전트 벤치마크에서 최고 수준의 성능 달성
- 자신의 작업물을 검토하는 능력이 크게 향상됨
- API를 통해 claude-opus-5 이름으로 이용 가능
Anthropic은 7월 24일에 Claude Opus 5를 출시했으며, 가장 눈에 띄는 숫자는 여러분의 API 청구서에 찍힐 금액입니다. 이 모델은 Fable 5의 프론티어 지능(frontier intelligence)에 근접하면서도 가격은 절반 수준입니다.
만약 여러분이 LLM(대규모 언어 모델)을 활용해 서비스를 구축한다면, 이 조합(최상위권 품질에 근접하면서 중간 단계의 비용)이 바로 핵심입니다. 실제로 무엇이 변했는지, 그리고 이것이 왜 중요한지 설명하겠습니다.
요약(TL;DR): Opus 5는 절반의 가격으로 Fable 5에 근접하는 품질을 달성했으며, Anthropic 자체의 코딩 및 에이전트 벤치마크(benchmarks)에서 최고 성능을 기록했습니다. 또한 자신의 작업물을 검토하는 능력이 눈에 띄게 향상되었습니다. 현재 API에서
claude-opus-5라는 이름으로 제공되며, 100만 토큰당 입력 $5 / 출력 $25의 가격으로 이용 가능합니다.

더 높은 노력을 투입할수록 더 높은 지능을 얻을 수 있으며, 낮은 노력은 더 빠르고 저렴한 실행을 위해 토큰을 보존합니다. 차트: Anthropic.
새로운 기능
Anthropic의 보고에 따르면, Opus 5는 Frontier-Bench 및 GDPval-AA와 같은 코딩 및 지식 작업 벤치마크에서 최첨단(state of the art) 성능을 보여주는 반면, 사이버 보안 분야에서는 여전히 그들의 Mythos 5 모델 뒤에 위치하고 있습니다. Anthropic 자체 평가(evals) 결과는 다음과 같습니다:
| 벤치마크 | Opus 5에 대해 Anthropic이 보고한 내용 |
|---|---|
| Frontier-Bench v0.1 (소프트웨어 엔지니어링) | 작업당 비용은 더 낮으면서 Opus 4.8의 점수를 두 배 이상 상회함 |
| ... | |
![]() | |
| 코딩 및 에이전트 벤치마크 (Frontier-Bench, CursorBench, AA Coding Agent Index). 차트: Anthropic. |
가격은 Opus 4.8과 동일하게 입력 100만 토큰당 $5, 출력 100만 토큰당 $25로 유지됩니다. 이제 Claude Max의 기본 모델이 되었으며, Claude Pro에서 가장 강력한 옵션입니다. API에서는 claude-opus-5로 사용 가능합니다.
코드 그 이상
코드 그 이상
이러한 패턴은 코딩 영역을 넘어에서도 유지됩니다. 추론 및 컴퓨터 사용 작업에서 Anthropic은 Opus 5가 주어진 비용 대비 여전히 선두를 달리고 있음을 보여줍니다.

지식 노동 및 추론: ARC-AGI 3, GDPval-AA, OSWorld 2.0, HLE, AutomationBench, DeepSearchQA. 차트: Anthropic.
주목할 만한 부분
벤치마크는 그저 벤치마크일 뿐입니다. 모델의 판단 사례가 더 흥미로운데, 이는 작업이 중단되는 것이 아니라 실제로 작업을 완료하는 에이전트에 관한 것이기 때문입니다:
🔹 실제 이미지를 볼 방법이 없는 기계 부품 그림을 받았을 때, Opus 5는 원시 픽셀에서 지오메트리(geometry)를 추출하기 위한 자체 컴퓨터 비전 파이프라인을 작성한 다음, 그 부품을 FreeCAD로 재구축했습니다. Anthropic에 따르면 경쟁 모델은 다섯 번의 시도 만에 이를 해결하지 못했습니다.
🔹 인기 오픈 소스 패키지 관리자에서 실제 버그를 받았을 때, 근본 원인을 찾아내고 커뮤니티 자체 패치가 놓친 엣지 케이스(edge case)를 수정했습니다. 경쟁 모델은 증상만 패치하고 끝났다고 선언했을 뿐입니다.
🔹 한 엔지니어는 새로운 거래소의 시장 데이터 피드를 한 세션 만에 구축했습니다. 테스트할 라이브 피드가 없었음에도 불구하고, Opus 5는 파싱(parsing)을 검증하기 위한 자체 테스트 하네스(test harness)를 작성했습니다.
이것이 변화입니다: '코드를 생성하고 기대하는' 수준에서 '검증하고, 반복하며, 자신의 작업을 확인한 후 넘겨주는' 수준으로 진화했다는 것입니다.
이것을 이용해 구축할 때 중요한 이유
유용한 작업당 비용(Cost per useful task)이 빠르게 하락하고 있습니다. 절반 가격에 근접한 최전선급 품질은 루프(loop) 내에서 감당할 수 있는 것이 무엇인지 변화시키며, 이는 장기간 실행되는 에이전트가 정확히 필요로 하는 것입니다. 만약 강력한 모델을 자율 파이프라인에 넣는 비용 때문에 망설였다면, 그 계산 방식 자체가 바뀌었습니다.
한 가지 솔직한 주의 사항이 있습니다. 이 수치들은 Anthropic이 자체적인 테스트 환경 (harness)에서 보고한 수치입니다. 독립적인 결과가 나올 때까지는 이를 절대적인 진리 (gospel)가 아닌 강력한 신호 (signal)로 취급하십시오. 그리고 만약 귀하의 작업이 공격적 보안 (offensive security) 분야를 다룬다면, 해당 기능은 의도적으로 Mythos 5 뒤에 머물러 있다는 점을 유의하십시오.

OSS-Fuzz에서, Opus 5는 Mythos 5(왼쪽)만큼 취약점을 잘 찾아내지만, 설계상 익스플로잇 (exploit) 작성 능력(오른쪽)은 훨씬 뒤처집니다. 차트 출처: Anthropic.
시작하기
Opus 5는 오늘 모든 플랫폼과 API에서 claude-opus-5라는 이름으로 출시되었으며, 100만 토큰당 $5 / $25의 가격으로 제공됩니다. 또한 약 2.5배 빠른 속도의 Fast 모드가 있으며, 두 가지 베타 기능이 추가되었습니다: 프롬프트 캐시 (prompt cache)를 무효화하지 않고 대화 중간에 도구 (tool)를 변경하는 기능, 그리고 API에서의 자동 모델 폴백 (fallback) 기능입니다.
위의 모든 차트는 Anthropic의 공식 발표 자료이며, 여기서는 논평 및 보도를 위해 제시되었습니다. 출처: Introducing Claude Opus 5
직접 사용해 보셨나요? "스스로의 작업을 검토하는 (it checks its own work)" 동작이 실제 프로젝트에서도 잘 유지되나요, 아니면 여전히 복불복인가요? 사람들이 무엇을 경험하고 있는지 궁금합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기