Claude Opus 5 출시: Fable 5 수준의 지능을 절반 가격에 제공
요약
Anthropic이 Opus 4.8을 뛰어넘는 성능의 Claude Opus 5를 출시했습니다. 이 모델은 심층 추론, 에이전트 기반 코딩, 멀티 에이전트 조정 능력이 대폭 강화되었으며, 기존 모델과 유사한 가격대에 Fable 5 수준의 지능을 제공합니다.
핵심 포인트
- 심층 추론 및 에이전트 기반 코딩 성능의 단계적 변화(step-change) 달성
- 1M 토큰 컨텍스트 윈도우 및 128k 출력 토큰 지원
- 멀티 에이전트 조정 및 테스트 시간 계산 스케일링 최적화
- Claude Code의 기본 모델로 즉시 적용 및 모든 주요 플랫폼 출시
-
Anthropic은 7월 24일 Claude Opus 5를 출시하며, 이를 단순한 정기 업데이트가 아닌 Opus 4.8을 뛰어넘는 단계적 변화(step-change)라고 명명했습니다.
-
이 모델은 기본 및 최대치로 1M 토큰의 컨텍스트 윈도우(context window)를 실행하며, 최대 128k 출력 토큰을 지원하고, 기본적으로 사고(thinking) 기능이 활성화되어 있습니다.
-
Anthropic은 Opus 4.8과 동일한 토큰당 가격을 유지하면서도, 약 절반의 가격으로 Fable 5 수준의 지능에 근접했다고 밝혔습니다.
-
Claude API, AWS, Google Cloud, Microsoft Foundry 등 모든 플랫폼에 동시에 출시되었으며, 현재 Claude Code의 기본 Opus 모델로 설정되어 있습니다.
Anthropic이 실제로 출시한 것
7월 24일, Anthropic은 Claude Opus 5를 출시했으며, 자체 문서에 기술된 이 릴리스의 성격에 대한 설명은 매우 직설적입니다. Anthropic은 이를 Claude Opus 4.8에 대한 점진적인 개선이 아닌 단계적 변화(step-change)라고 부르며, 가장 큰 이점은 심층 추론(deep reasoning), 에이전트 기반 코딩(agentic coding) 및 장기 과제(long-horizon tasks), 그리고 테스트 시간 계산 스케일링(test-time compute scaling)에서 나타난다고 말합니다. 이는 마케팅 용어가 아닌 구체적인 주장이며, 단일 벤치마크 스크린샷에서 승리하기 위해 만들어진 모델이 아니라 긴 도구 사용 루프(tool-use loops) 동안 과업을 유지하도록 설계된 모델로서 발표문의 다른 모든 곳에서 모델이 포지셔닝된 방식과 일치합니다.
역량 목록은 길고 대부분 실용적입니다. Anthropic은 실제 버그에 대해 높은 적중률을 보이고 오탐(false positives)이 적으며, 낮은 노력 수준에서도 성능을 유지하는 더 나은 코드 리뷰 및 버그 탐지 능력을 강조합니다. 또한 차트, 문서, 다이어그램을 읽고, 모델이 자신의 작업을 자르고 확인할 수 있는 도구를 가졌을 때 UI 및 프론트엔드 비주얼을 복제하는 비전(vision) 개선 사항을 강조합니다. 아울러 실제 수식이 포함된 다중 시트 스프레드시트와 구조화된 슬라이드 덱을 생성하는 사무 및 문서 작업, 그리고 라이터-베리파이어(writer-verifier) 패턴을 사용하여 하위 에이전트 팀을 운영하고 에이전트들이 서로의 출력물을 방해하는 사례를 줄인 멀티 에이전트 조정(multi-agent coordination) 능력을 강조합니다.
눈에 띄는 점은 이 모델이 더 똑똑한 채팅 어시스턴트(chat assistant)로 홍보되지 않았다는 것입니다. 목록에 있는 모든 기능은 동일한 대상, 즉 사람이 매 단계를 확인하지 않고 에이전트 루프(agent loop), 코딩 세션(coding session), 또는 다단계 워크플로우(multi-step workflow) 내에서 Claude를 장시간 실행하는 사람들을 가리키고 있습니다. 이들은 바로 Lab을 읽는 사람들이기도 하므로, Claude를 기반으로 구축하거나, Claude Code를 매일 사용하거나, 혹은 이번 주에 자신의 구독 서비스로 무엇을 얻었는지 알고 싶은 사람들에게 실제로 무엇이 변하는지 살펴보는 것은 가치가 있습니다.
Claude Opus 5는 또한 동적 워크플로우(dynamic workflows), 중첩된 서브에이전트(nested subagents), 그리고 MCP 핸들링(MCP handling)에 대한 확장된 지원과 함께 Claude Code 자체 내에서도 새로운 기본 Opus 모델이 되었습니다. 따라서 이것은 단순한 API 출시가 아니었습니다. 7월 24일 이후에 Claude Code를 여는 사람은 설정을 변경하지 않고도 이미 새 모델을 실행하게 됩니다.
실제로 중요한 컨텍스트 윈도우(Context Window) 및 에포트(Effort)의 변화
두 가지 숫자가 Claude Opus 5의 한계를 정의합니다: 1M 토큰의 컨텍스트 윈도우(context window)와 128k의 최대 출력 토큰(max output tokens)입니다. 주목할 만한 컨텍스트 윈도우의 세부 사항은 1M이 기본값이자 최대값이며, 선택할 수 있는 더 작은 컨텍스트 변형이 없다는 점입니다. Anthropic은 지시 이행(instruction following), 도구 호출(tool calling), 그리고 추론(reasoning) 품질이 컨텍스트 윈도우의 끝부분으로 갈수록 저하되지 않고 전체 윈도우에 걸쳐 일관되게 유지된다고 밝히고 있습니다. 이는 긴 컨텍스트 작업(long-context work)이 보통 직면하게 되는 실제 병목 현상입니다.
이제 '생각하기(Thinking)' 기능이 기본적으로 활성화되어 있으며, 이는 명시적으로 요청하지 않으면 생각 없이 요청을 실행했던 Opus 4.8과는 실질적인 동작 변화를 의미합니다. Opus 5에서 모델은 각 턴(turn)에 대해 언제, 얼마나 생각할지를 스스로 결정하며, 대신 사용자가 조절할 수 있는 레버는 '에포트(effort)'라고 불리는 다섯 단계(low, medium, high, xhigh, max)입니다. 'high'가 기본값입니다. Anthropic의 자체 가이드라인은 'high'에서 시작하여, 토큰과 지연 시간(latency)을 절약하기 위해 품질이 유지되는 선에서 단계를 낮추거나, 가장 어려운 문제를 해결하기 위해 단계를 높이는 것입니다. 이는 기존의 온/오프(on/off) 방식의 생각하기 토글(thinking toggle)과는 비용을 생각하는 방식 자체가 의미 있게 다릅니다.
기존 통합(integration)을 사용 중인 사용자라면 주의해야 할 중대한 변경 사항(breaking change)이 이 변화 속에 숨어 있습니다. Opus 5에서는 노력 수준(effort level)이 'high' 이하일 때만 생각하기(thinking) 기능을 완전히 비활성화할 수 있습니다. 이제 'thinking'을 끄려고 시도하면서 노력 수준을 'xhigh' 또는 'max'로 설정하면 오류가 반환됩니다. 만약 기존 설정이 'high' 노력 수준에서 명시적으로 'thinking'을 비활성화하고 있다면, 노력 수준을 낮추거나 'thinking' 비활성화를 중단해야 합니다.
몇 가지 작은 변경 사항들이 이번 출시를 완성합니다. 프롬프트 캐싱(Prompt caching)은 이제 Opus 4.8의 이전 최소 기준인 1,024 토큰의 절반인 512 토큰만큼 짧은 프롬프트에서도 작동하므로, 더 짧은 재사용 가능 프롬프트도 코드 변경 없이 캐싱의 이점을 누릴 수 있습니다. 또한 대화 중간에 도구(tool)를 변경할 수 있는 베타 기능도 제공됩니다. 이를 통해 세션 전체에 대해 고정된 도구 목록을 다시 보낼 필요 없이, 프롬프트 캐시를 유지하면서 턴(turn) 사이에 도구를 추가하거나 제거할 수 있습니다. 서류상으로는 작아 보이지만, 작업의 각 단계마다 서로 다른 도구가 필요한 에이전트(agent)를 구축하는 모든 이들에게 실무적으로 매우 유용합니다.
실제 가격 책정의 위치
Anthropic이 자체적인 프레임워크에서 가장 강력하게 내세우는 수치는 성능 대비 가격입니다. Opus 5의 토큰당 가격은 Opus 4.8과 동일하며 전혀 인상되지 않았지만, Anthropic은 Opus 5가 자사의 가장 강력한 공개 모델인 Fable 5 지능에 근접하면서도 비용은 Fable 5의 약 절반 수준이라고 밝히고 있습니다. 이는 이번 출시를 다룬 거의 모든 매체에서 다룬 핵심 비교 사항이며, Anthropic이 올해 내내 계층(tier)을 포지셔닝해 온 방식과도 일치합니다. 즉, 가장 어려운 문제에는 Fable 5를, 실제 대량의 볼륨으로 실행되어야 하는 모든 진지한 작업에는 Opus를 사용하는 방식입니다.
또한 아직 연구 프리뷰(research preview) 단계인 Fast 모드가 있으며, 이는 Claude API에서만 사용할 수 있고 Bedrock, Google Cloud 또는 Microsoft Foundry에서는 아직 사용할 수 없습니다. 이 모드는 기본 모드보다 약 2.5배 더 빠르게 작동하며 토큰당 비용이 유의미하게 더 높습니다. 이는 특정 워크로드에서 낮은 지연 시간(latency)이 필요하고, 이를 최적화하는 대신 비용을 지불할 의사가 있는 사용자들에게 흔히 적용되는 트레이드오프(trade-off)입니다.
Claude 구독이나 API 예산이 매달 실제로 무엇을 살 수 있는지 추적하는 사람들에게, 이번 출시는 단순히 "새로운 모델이 나왔다"는 느낌보다는 "같은 돈으로 이제 더 똑똑한 모델을 사용할 수 있다"는 느낌으로 다가옵니다. 저는 이번 출시 전에 Claude Fable 5 vs Opus 4.8: Is Double the Price Worth It에서 Fable 5와 Opus 4.8의 가격 및 성능을 비교한 상세 분석글을 작성한 바 있는데, Opus 5는 Anthropic이 정가(sticker price)를 전혀 건드리지 않고도 그 계산식을 Opus에 유리하게 유의미하게 변화시켰습니다.
이번 출시가 일반적인 모델 업데이트와 다르게 느껴지는 이유
모델 출시는 매우 빈번하게 일어나기 때문에, 각각의 출시를 사소한 버전 업데이트로 취급하고 넘어가기 쉽습니다. 하지만 이번 출시는 특정한 이유로 다르게 느껴집니다. 거의 모든 주요 기능(headline capability)이 대화의 품질보다는 에이전트적 작업(agentic work)을 겨냥하고 있기 때문입니다. 장기적 과업 완료(Long-horizon task completion), 다중 에이전트 협업(multi-agent coordination), 코드 리뷰 정확도, 그리고 1M 토큰의 전체 컨텍스트(context)에 걸친 일관된 동작은 모두 Claude를 한 번에 하나씩 질문하는 용도가 아니라, 루프(loop) 안에서 실행하는 사람들에게 특히 중요한 요소들입니다.
이 점이 중요한 이유는 그것이 바로 제가 Claude Code 내부에서 매일 Claude를 사용하는 방식이기 때문입니다. 저는 다단계 빌드(multi-step builds)를 실행하고, 제가 출력을 확인하는 동안 서브 에이전트(subagents)가 작업의 일부를 처리하도록 맡깁니다. 낮은 노력 수준에서도 정확성을 유지하고, 지시를 받지 않아도 스스로 자신의 작업을 검증하는 모델은 실제로 작업에 필요한 감독(oversight)의 양을 변화시킵니다. Anthropic의 자체 마이그레이션 노트(migration notes)에서는 "최종 검증 단계를 포함하라" 또는 "서브 에이전트를 사용하여 검증하라"와 같이 기존에 사용하던 프롬프팅 패턴(prompting patterns)을 제거해야 한다고 명시하고 있습니다. Opus 5가 이미 스스로 그런 작업을 더 많이 수행하며, 어차피 요청할 경우 과도하게 검증(over-verifies)하기 때문입니다. 이는 작은 디테일이지만, 연구소(lab)가 벤치마크 질문에 어떻게 답하는지가 아니라 실제 에이전트 루프(agent loop)에서 모델이 어떻게 행동하는지를 최적화할 때만 나타나는 종류의 디테일입니다.
함께 깊이 생각해 볼 만한 또 다른 디테일은 출시 전략 그 자체입니다. Opus 5는 Claude API, AWS Bedrock, Google Cloud, 그리고 Microsoft Foundry 전반에 걸쳐 동시에 출시되었으며, Opus 4.8은 중단되지 않고 모든 곳에서 그대로 사용 가능한 상태로 유지되었습니다. 기존 모델을 사용하는 사용자는 준비가 되기 전까지 새로운 모델로 강제 전환되지 않으며, 특정 클라우드 플랫폼을 기다리는 사용자도 기능적 동등성 (parity)을 위해 몇 주씩 기다릴 필요가 없습니다. 주력 제품이 점점 더 "당신의 에이전트가 구동되는 기반"이 되어가는 기업으로서, 이러한 균일하고 강제 마이그레이션이 없는 출시 방식은 이 정도 규모에서 신뢰성 (reliability)을 얼마나 진지하게 다루고 있는지를 보여주는 조용한 신호입니다.
저는 Claude Fable 5 vs GPT-5.5 vs Gemini 3.1 Pro: Who Leads Now에서 Anthropic의 지난 세대 최상위 모델들이 업계와 비교했을 때 어느 정도 수준인지 비교한 바 있는데, 이번 출시는 그러한 비교 결과가 오랫동안 고착되지 않게 만드는 종류의 행보입니다. 플래그십 (flagship) 모델과의 격차를 줄이는 더 저렴한 티어 (tier)의 등장은 이미 최상위 티어를 유료로 사용하던 사람들뿐만 아니라, 두 모델 사이에서 고민하는 모든 이들의 계산법을 바꿔 놓습니다.
결론 (Bottom Line)
Claude Opus 5는 제가 일상적인 출시로 분류할 만한 것이 아닙니다. 컨텍스트 윈도우 (context window)는 축소되지 않고 최대치로 고정되어 있으며, 사고 (thinking) 과정은 요청 시가 아닌 기본값으로 실행됩니다. 또한 거의 모든 기능적 개선 사항은 단일하고 날카로운 답변보다는 길고 다단계적인 작업을 수행하는 에이전트 (agents)를 향하고 있습니다. Anthropic은 Opus 4.8이 이미 자리 잡고 있던 가격대에 이를 책정하면서도, Fable 5와의 격차를 대부분 해소했다고 주장합니다. 이는 단순히 리더보드 (leaderboard)에 더 큰 숫자를 추가하는 것이 아니라, 특정 작업에 어떤 티어가 적합한지에 대한 판단 기준 자체를 실제로 바꾸는 종류의 행보입니다.
Claude를 기반으로 서비스를 구축하거나 저처럼 매일 Claude Code를 실행하는 분들에게 실질적인 결론은 간단합니다. 만약 기본 Opus 티어를 사용 중이라면, 가격은 변하지 않았지만 모델은 이미 여러분도 모르는 사이에 변했습니다. 특히 사고(thinking) 및 노력(effort)과 관련된 몇 가지 작은 동작 변화가 있으므로, 이미 프로덕션(production) 환경에서 운영 중인 서비스가 있다면 빠르게 점검해 볼 가치가 있습니다. 저는 더 많은 실제 사용 사례가 나타남에 따라 이것이 Fable 5 및 나머지 경쟁 모델들과 어떻게 맞붙는지 계속 지켜볼 것이며, 상황에 다시 변화가 생긴다면 이곳에 글을 남기겠습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기