Claude Opus 5 API: Fable 5-Class를 절반 가격에, 완전 가이드
요약
Anthropic이 Fable 5 대비 절반 가격으로 출시한 Claude Opus 5 API에 대한 가이드입니다. 1M 컨텍스트 윈도우와 에이전트형 코딩에 최적화된 성능을 제공하며, 기존 Opus 4.8 대비 변경된 적응형 사고(Adaptive thinking) 기능 등을 다룹니다.
핵심 포인트
- Fable 5 대비 50% 저렴한 가격($5/$25)으로 출시
- 1M 토큰 컨텍스트 윈도우 및 에이전트형 작업 최적화
- Opus 4.8 대비 적응형 사고(Adaptive thinking) 기본 활성화
- Fast Mode 사용 시 최대 2.5배 빠른 출력 속도 제공
Claude Opus 5 (claude-opus-5)가 2026년 7월 24일 $5/$25의 가격으로 출시되었습니다. 이는 Fable 5 가격의 절반 수준입니다. 벤치마크, Opus 4.8에서 5로의 API 변경 사항, 그리고 ofox를 통해 호출하는 방법을 알아봅니다.
Anthropic이 출시한 것
Claude Opus 5는 복잡한 에이전트형 코딩 (agentic coding) 및 기업용 업무를 위해 Anthropic이 새롭게 권장하는 기본 모델입니다. 모델 ID는 claude-opus-5이며, 날짜가 지정되지 않은 고정된 스냅샷(snapshot) 형태이고 버전 접미사가 없습니다. 이 모델은 1M 토큰의 전체 컨텍스트 윈도우 (context window), 128K의 최대 출력 토큰 (베타 헤더를 포함한 Message Batches API를 통해 300K까지 확장 가능), 그리고 2026년 5월 지식 컷오프 (knowledge cutoff)를 제공합니다.
가격 책정은 상당한 성능 대비 비용 비율을 나타냅니다: "Claude Fable 5의 프런티어 지능 (frontier intelligence)에 근접하면서도 가격은 절반인, 사려 깊고 선제적인 모델"입니다. Fable 5는 백만 토큰당 $10/$50의 비용이 들지만, Opus 5는 입력 $5/출력 $25로 책정되었습니다. 이는 지난 5월부터 유지된 Opus 4.8의 요율과 일치하며, Fable 5보다 50% 저렴합니다. Fast Mode는 기본 비용의 두 배로 동일한 모델을 최대 2.5배 빠른 출력 속도로 실행합니다.
Fable 5는 여전히 Anthropic의 가장 강력한 모델로 남아 있습니다. Opus 5는 Fable의 프리미엄 없이 그 성능의 대부분을 원하는 사용자를 타겟으로 합니다.
벤치마크: Anthropic 자체 수치
제시된 모든 수치는 Anthropic 내부 수치이며 검증되지 않은 벤더 출시 수치로, 제3자 결과가 아닙니다. 이를 최선의 시나리오로 간주하고, 도입 전 독립적인 평가를 수행하십시오.
| 벤치마크 | Anthropic 내부 수치 (미검증) |
|---|---|
| Frontier-Bench v0.1 | 다른 모든 모델을 능가함; Opus 4.8 점수의 두 배 이상 |
| ... |
일관된 테마는 에이전트형 및 컴퓨터 사용 (computer-use) 작업, 즉 장기적 코딩 (long-horizon coding), 데스크톱 제어, 실제 작업 자동화에 걸쳐 나타나며, 여기서 Opus 5는 훨씬 적은 비용으로 Fable 5와 대등하거나 경쟁 모델을 능가합니다. Anthropic은 한 가지 솔직한 한계를 인정합니다: Opus 5는 사이버 보안 공격 (cybersecurity-exploitation) 및 생물학 연구 (biology-research) 작업에서 Mythos 5에 뒤처지며, 이러한 작업은 방어용으로 별도의 모델 라인에서 처리됩니다. 해당되지 않는 워크로드(workloads)에서는 격차가 발생하지 않습니다.
Opus 4.8에서 변경된 사항 (코드를 깨뜨리는 부분)
Opus 5는 대부분의 측면에서 4.8과 동일한 요청 인터페이스 (request surface)를 유지하지만, 추가적인 수정 없이 모델 문자열 (model string)만 교체하는 사용자들에게는 세 가지 변경 사항이 놀라움을 줄 것입니다.
1. 적응형 사고 (Adaptive thinking)가 기본적으로 활성화됨
Opus 4.8에서는 thinking 필드가 없는 요청이 사고 과정 없이 실행되었습니다. Opus 5에서는 동일한 요청이 이제 적응형 사고 (adaptive thinking)와 함께 실행됩니다. max_tokens는 사고 과정과 가시적인 응답을 합친 전체 출력에 대한 엄격한 제한 (hard cap)이므로, 사고 과정이 없도록 튜닝된 4.8용 워크로드 (workloads)에서는 출력이 잘릴 (truncate) 수 있습니다. max_tokens를 재검토하거나, 이전 동작을 유지하려면 thinking: {"type": "disabled"}를 전달하세요.
2. 사고 비활성화는 high 노력 (effort) 수준으로 제한됨
이것은 사용자들이 예상치 못한 새로운 400 에러입니다. 사고를 비활성화할 수 있지만, 노력 (effort) 수준이 high 이하일 때만 가능합니다. thinking: {"type": "disabled"}를 xhigh 또는 max 노력 수준과 결합하면 거부 (rejection)가 발생합니다:
# Opus 5에서 거부됨 — 400 에러
client.messages.create(
model="claude-opus-5",
...
3. 캐시 최소값이 512 토큰으로 감소함
캐시 임계값 (Cache thresholds)이 4.8의 1,024 토큰에서 감소했습니다. 이전에는 너무 작아서 캐싱되지 않았던 짧은 시스템 프롬프트 (system prompts)가 이제 코드 수정 없이도 캐시 엔트리 (cache entries)를 생성합니다. 이는 프롬프트 캐싱 (prompt-caching) 비용 측면에서 작지만 무료인 이득입니다.
두 가지 추가 고려 사항: 대화 중간의 도구 변경 (mid-conversation tool changes)이 이제 프롬프트 캐시를 무효화하지 않고도 가능해졌으며 (beta 헤더 mid-conversation-tool-changes-2026-07-01), Opus 5에는 사이버 보안 안전 분류기 (cybersecurity safety classifiers)가 탑재되어 stop_reason: "refusal"에 대한 처리가 필요합니다. 이때 선택적으로 자동 모델 폴백 (automatic model fallbacks)을 사용할 수 있습니다 (fallbacks: "default", beta 헤더 server-side-fallback-2026-07-01).
변경되지 않은 요소: 가격, 1M 컨텍스트 윈도우 (context window), 128K 출력, 그리고 4.8에서의 엄격한 거부 사항들—기본값이 아닌 temperature/top_p/top_k, 수동 budget_tokens, 그리고 어시스턴트 프리필 (assistant prefill)은 모두 400 에러를 반환합니다. Priority Tier는 여전히 지원되지 않습니다.
노력 (Effort) 및 프롬프팅 (Prompting) 참고 사항
Opus 5는 low, medium, high, xhigh, max로 구성된 전체 노력 계층 (effort ladder)을 지원하며, Claude API 및 Claude Code에서는 high가 기본값으로 설정됩니다. Anthropic은 4.8의 설정을 그대로 가져오기보다는 새로운 노력 스윕 (effort sweep)을 실행할 것을 권장하며, 성능이 중요한 작업에는 max를 테스트해 볼 것을 권장합니다 (xhigh 또는 max를 사용할 경우 약 64K부터 시작하는 큰 max_tokens를 할당하세요).
두 가지 행동 변화에 따라 프롬프트 검토가 필요합니다. Opus 5는 명시적인 지시 없이도 자신의 작업을 스스로 검증하므로, 명시적인 "출력을 다시 확인하세요 (double-check your output)" 지시는 이제 과잉 검증을 유발합니다. 따라서 해당 지시어를 제거하십시오. 기본 응답은 4.8보다 더 길게 실행됩니다. 노력 (effort) 수준을 낮추면 사고 과정 (thinking)은 줄어들지만 가시적인 답변 길이는 줄어들지 않으므로, 더 짧은 출력을 원한다면 간결함 (conciseness)이나 목표 길이를 직접 프롬프트에 지정하십시오.
ofox를 통해 Opus 5를 호출하는 방법
ofox.ai의 모델 ID는 anthropic/claude-opus-5이며, 다른 모든 모델과 동일한 OpenAI 호환 엔드포인트를 사용합니다. 별도의 Anthropic 계정이나 결제가 필요하지 않습니다. 기존 OpenAI SDK의 대상(point)을 ofox 베이스 URL로 설정하고 두 개의 문자열만 변경하면 됩니다:
from openai import OpenAI
client = OpenAI(base_url="https://api.ofox.ai/v1", api_key="your-ofox-key")
...
적응형 사고 (adaptive thinking) 및 effort 파라미터를 사용하려면 대신 Anthropic 네이티브 엔드포인트를 호출하십시오. 이 경우 모델 ID에서 제공자 접두사 (provider prefix)가 제거됩니다:
import anthropic
client = anthropic.Anthropic(
...
하나의 게이트웨이를 통해 실행하면 마이그레이션 여부를 실증적으로 판단할 수 있습니다. 하나의 키를 사용하여 Opus 5, Opus 4.8, Fable 5에 동일한 프롬프트를 입력하고, 프로덕션 환경을 전환하기 전에 실제 워크로드에 대한 품질과 토큰 수를 비교해 보십시오.
Opus 5 vs Fable 5 vs Sonnet 5: 무엇을 선택할 것인가
- Claude Opus 5 ($5/$25)—에이전트 기반 코딩 (agentic coding), 컴퓨터 사용 (computer use), 그리고 장기적 관점의 기업용 작업 (long-horizon enterprise tasks)을 위한 새로운 기본 모델입니다. 현재 라인업 중 달러당 최고의 성능을 제공합니다.
- Claude Fable 5 ($10/$50)—최상위 모델입니다. 작업에 진정으로 가장 유능한 모델이 필요하고 비용이 부차적인 경우에만 선택하십시오. 많은 에이전트 벤치마크 (agentic benchmarks)에서 Opus 5는 절반의 가격으로 오차 범위 내의 성능을 보여줍니다.
- Claude Sonnet 5 ($3/$15)—속도 및 비용 계층입니다. Opus 수준의 추론 깊이가 필요하지 않은 대량 작업 또는 지연 시간에 민감한 (latency-sensitive) 작업에서 코딩 시 Opus에 근접한 품질을 제공합니다.
Opus 4.8 사용자에게 이는 깔끔한 마이그레이션 (migration)입니다. 동일한 가격, 더 높은 점수, 그리고 위에서 언급한 세 가지 주의 사항과 함께 모델 문자열(model-string) 하나만 변경하면 됩니다.
결론 (Verdict)
Opus 5는 가격에 별도의 조건이 붙지 않는 또 다른 Opus 업그레이드입니다. 동일한 $5/$25 가격을 유지하면서 코딩 및 컴퓨터 사용 전반에서 실질적으로 더 높은 점수를 기록했으며, Fable 5에 근접한 성능을 절반의 비용으로 제공한다는 Anthropic의 주장은 광범위한 벤치마크 세트 전반에서 입증되었습니다. 주의 사항은 좁고 정직합니다: 벤치마크 수치는 Anthropic 내부 자료이며 검증되지 않았으므로 (직접 평가를 수행하십시오), 현재 사고 과정 비활성화 (disabling thinking)는 높은 노력 수준 (high effort levels)과 충돌하며, 기본 출력 실행 시간이 더 길어지므로 max_tokens와 지연 시간 (latency) 예산을 주의 깊게 살펴봐야 합니다.
새로운 프로젝트의 경우 Opus 5로 시작하십시오. 4.8을 사용 중인 프로덕션 환경의 경우, 모델 문자열을 변경하고, max_tokens를 재검토하며, 사고 과정을 비활성화하는 모든 요청을 감사한 후 배포하십시오.
원문 게시지: ofox.ai/blog.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기