
Claude Opus 4.8: 노력 제어, 동적 워크플로, 그리고 기본적으로 정직한 코딩 에이전트
요약
Anthropic이 출시한 새로운 플래그십 모델 Claude Opus 4.8의 주요 특징과 성능을 분석합니다. 노력 제어 기능, 동적 워크플로, 코딩 에이전트의 정직성 개선 및 벤치마크 성능 향상을 다룹니다.
핵심 포인트
- 요청당 노력 단계(low~max)를 조절하는 노력 제어 기능 도입
- 수백 개의 서브 에이전트를 활용하는 동적 워크플로 지원
- SWE-bench Pro 및 USAMO 등 주요 벤치마크 성능 대폭 향상
- 코딩 에이전트의 기만적 동작 감소 및 정직성 개선
프런티어 모델 (Frontier model) 경쟁은 불규칙하게 진행되어 왔습니다. OpenAI는 GPT-5.5와 새로운 Codex 라인을 출시했습니다. Google은 Gemini 3.1 Pro와 더 빠른 Gemini Flash를 밀어붙였습니다. xAI는 Grok을 지속적으로 반복 개선하고 있습니다. 그리고 이제 Anthropic은 Opus 4.7 출시 단 41일 만에 Claude Opus 4.8을 출시했습니다. 이는 그들에게 이례적으로 짧은 출시 주기이며, 2026년의 나머지 기간이 어떻게 흘러갈지에 대한 명확한 신호입니다.
Opus 4.8은 화려한 리브랜딩이 아닙니다. 주요 수치들은 실제적입니다 (SWE-bench Pro 69.2%, USAMO 2026 96.7%, 1M 토큰에서의 GraphWalks가 40.3%에서 68.1%로 급증). 하지만 더 흥미로운 이야기는 구조적인 부분입니다: 요청당 조절할 수 있는 노력 제어 (effort controls), 수백 개의 병렬 서브 에이전트 (subagents)를 오케스트레이션하는 동적 워크플로 (dynamic workflows), 이전보다 약 3배 저렴해진 빠른 모드 (fast mode), 그리고 에이전트를 신뢰하기 어렵게 만드는 과도하게 자신만만하고 약간 기만적인 코딩 동작의 측정 가능한 감소입니다.
이 글에서 저는 Opus 4.8에 대해 알아야 할 모든 것을 안내해 드릴 것입니다. 출시 세부 사항, 새로운 노력 단계 (effort tiers), Claude Code의 동적 워크플로 (Dynamic Workflows) 기능, 가격 변경 사항, 정직성 및 정렬 (alignment) 개선 사항, 오늘 바로 구축할 수 있는 두 가지 실용적인 사례, 그리고 여전히 부족한 부분에 대한 솔직한 평가를 다룰 것입니다. 글을 마칠 때쯤이면, 여러분은 언제 업그레이드해야 할지, 언제 기다려야 할지, 그리고 새로운 제어 기능을 실제로 어떻게 사용해야 할지에 대한 명확한 멘탈 모델 (mental model)을 갖게 될 것입니다.
Claude Opus 4.8이란 무엇인가?
Claude Opus 4.8은 Anthropic의 새로운 플래그십 모델로, 2026년 5월 28일에 출시되었으며 Claude API, Amazon Bedrock, Google Cloud Vertex AI, 그리고 Microsoft Foundry를 통해 즉시 사용할 수 있습니다. API 모델 ID는 claude-opus-4-8입니다. 이 모델은 Opus 4.7과 동일한 주요 가격대로 출시되었으며, 100만 토큰(1M-token)의 컨텍스트 창(context window)을 유지하며, 에이전트 기반 코딩(agentic coding), 장기 추론(long-horizon reasoning), 그리고 수일에 걸친 워크플로(multi-day workflows)에 최적화되어 배치되었습니다.
Opus 4.8을 돋보이게 만드는 특징은 다음과 같습니다:
- 모든 곳에서 사용 가능한 노력 제어 (Effort controls): 요청당 low, high (기본값), extra (
xhigh), max 티어를 선택할 수 있습니다. high 티어는 Opus 4.7의 기본값과 거의 동일한 토큰을 소모하면서도 더 나은 결과물을 내도록 조정되었습니다. - Claude Code의 동적 워크플로 (Dynamic Workflows): 모델이 작업을 계획하고, 수백 개의 병렬 서브 에이전트(subagents)를 실행하며, 적대적 방식으로 출력을 검증하고, 수일에 걸친 실행 과정에서 작업을 재개할 수 있도록 하는 연구 프리뷰(research preview) 기능입니다.
- 더 저렴해진 패스트 모드 (Fast mode): 백만 토큰당 $10/$50의 가격으로 2.5배 빠른 출력 속도를 제공하며, 이는 이전 Opus 패스트 모드보다 약 3배 저렴합니다.
- 기본적인 정직함 (Honesty by default): Opus 4.7 대비 보고되지 않은 코드 결함이 4배 감소했으며, 결함이 있는 결과를 비판 없이 보고하는 비율이 0%를 기록했습니다(해당 테스트에서 0%를 달성한 최초의 Claude 모델). 또한 과잉 확신(overconfidence)이 10배 감소했습니다.
- 대폭 향상된 에이전트 기반 코딩 성능: SWE-bench Pro에서 69.2%를 기록하며, 해당 벤치마크에서 발표된 모든 경쟁 모델을 앞질렀습니다.
- 장기 컨텍스트 검색의 돌파구: 100만 토큰에서의 GraphWalks BFS 성능이 F1 점수 기준 40.3%에서 68.1%로 급증했으며, 이는 이번 출시에서 단일 벤치마크 기준 가장 큰 상승폭입니다.
- 새로운 API 사용 편의성 (API ergonomics): Messages API가 이제
messages배열 내부에system항목을 허용하여, 프롬프트 캐시(prompt cache)를 깨뜨리지 않고도 작업 중간에 지침(instructions)을 업데이트할 수 있습니다.
가격 및 가용성
Opus 4.8은 Opus 4.7과 동일한 표준 요율로 출시되어, 업그레이드 비용 계산을 간편하게 유지합니다.
- Standard (표준): 입력 토큰 100만 개당 $5, 출력 토큰 100만 개당 $25.
- Fast mode (빠른 모드): 출력 속도가 약 2.5배 빠른 대신 토큰 100만 개당 $10 / $50.
Anthropic은 이를 "이전 모델의 빠른 모드보다 3배 저렴하다"라고 설명하는데, 이것이 이번 업데이트의 핵심입니다. 즉, 기존 Opus의 빠른 모드에서는 비용 문제로 경계선에 있었던 지연 시간 민감형 워크로드(latency-sensitive workloads)가 4.8에서는 경제적으로 타당해졌다는 의미입니다. - Context window (컨텍스트 창): 1,000,000 토큰, 4.7과 동일.
- Access (접근): Claude API, Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry, claude.ai, Claude Code, Cowork, 그리고 (출시일 기준) GitHub Copilot.
가격 변동이 없었기 때문에, 대부분의 팀에게 업그레이드 결정은 벤치마크 성능과 신뢰성 향상이 자신들의 특정 워크로드에 도움이 되는지의 여부에 달려 있습니다.
Benchmark Performance (벤치마크 성능)
벤치마크의 변화량(deltas)은 이번 출시에서 가장 명확한 부분입니다.
Coding (코딩)
- SWE-bench Pro: 69.2% (Opus 4.7의 64.3%에서 상승). 비교를 위해 말씀드리자면, GPT-5.5는 58.6%이며 다음 경쟁 모델은 54.2%입니다.
- SWE-bench Verified: 88.6% (87.6%에서 상승).
- SWE-bench Multilingual: 84.4% (80.5%에서 상승).
Opus 4.8은 모든 SWE-bench 변형 모델에서 선두를 달리고 있습니다. 이는 오늘날 코딩 에이전트(coding agent)를 구축하는 모든 이들에게 가장 유용한 핵심 수치입니다.
Math and Reasoning (수학 및 추론)
- USAMO 2026: 96.7% (4.7의 69.3%에서 상승). 단 한 번의 모델 사이클에서 27.4포인트가 상승한 것은 일반적인 벤치마크 변화량이 아닙니다. Anthropic은 이를 단순한 튜닝(tuning)의 승리가 아니라, 수학적 추론 깊이의 질적인 변화라고 설명합니다.
Long-Context Retrieval (장기 컨텍스트 검색)
- GraphWalks BFS at 1M tokens: 68.1% F1 (40.3%에서 상승).
- GraphWalks Parents at 1M tokens: 83.3% F1 (56.6%에서 상승).
이것은 이번 출시에서 가장 큰 상대적 격차입니다. 만약 귀하의 애플리케이션이 긴 문맥 검색 (long-context retrieval)에 크게 의존한다면 (법률 검토, 대규모 리포지토리 탐색, 연구 합성 등), 해당 작업에 있어 4.8은 4.7과는 다른 모델입니다.
기타 주목할 만한 점수
- HLE (도구 사용 시): 57.9%
- OSWorld-Verified (컴퓨터 사용): 83.4%
- MCP-Atlas: 82.2%
- Finance Agent v2: 53.9%
성능이 하락한 부분
- GPQA Diamond: 93.6% (4.7의 94.2% 대비). 포화 상태에 가까운 벤치마크이므로 상위권에서의 변동은 예상 가능하지만, 언급할 가치가 있습니다.
- Terminal-Bench 2.1: 74.6%로, GPT-5.5의 78.2%에 뒤처짐.
- 다국어 작업 (Multilingual tasks): 여러 언어에서 Gemini 3.1 Pro 및 GPT-5.5에 뒤처짐.
벤치마크는 방향성 지표로만 참고하십시오. 아래에서 설명할 정직성 (honesty) 및 신뢰성 (reliability)의 차이가 실제 프로덕션 사용에는 더 중요합니다.
노력 제어 (Effort Control): 여러분이 기다려온 조절 노브
Opus 4.8은 네 가지 노력 단계 (effort tiers)를 노출하며, 요청마다 이를 설정할 수 있습니다.
- Low (낮음): 빠른 응답, 최소한의 토큰 사용. 요약, 분류 및 간단한 질의응답 (Q&A)에 최적입니다.
- High (높음, 기본값): Anthropic의 "최적의 균형" 단계입니다. Opus 4.7의 기본값과 유사한 토큰을 사용하도록 튜닝되었으면서도 코딩 작업에서는 이를 능가합니다.
- Extra (추가,
xhigh): 어려운 작업 및 장시간 실행되는 비동기 워크플로 (async workflows)에 권장됩니다. - Max (최대): 최대 토큰 깊이. 비용을 고려하지 않고 오직 품질만을 우선시하는 경우를 위해 남겨두십시오.
노력 조절 노브는 claude.ai 및 Cowork (모든 플랜), 기존 노력 메뉴를 통한 Claude Code, 그리고 API에서 제공됩니다. 새로운 높은 기본값을 수용하기 위해 Claude Code의 속도 제한 (rate limits)이 상향되었습니다. 이는 과거에 엔터프라이즈 영업 상담을 통해서만 가능했던 종류의 제어 방식이며, 이를 일급 요청 파라미터 (first-class request parameter)로 제공받는 것은 조용하지만 의미 있는 승리입니다.
실질적인 마이그레이션 휴리스틱 (heuristic): 먼저 기본값인 High 단계로 Opus 4.8로 전환한 다음, 프로덕션에 적용하기 전에 xhigh에서 대표적인 작업들을 샘플링하여 토큰 비용 차이를 모델링하십시오.
동적 워크플로 (Dynamic Workflows): 수백 개의 서브에이전트, 며칠이 걸리는 작업
이번 릴리스의 가장 큰 새로운 기능은 **동적 워크플로 (Dynamic Workflows)**입니다. 이는 Claude Code 내의 리서치 프리뷰 (research preview) 기능으로, Opus 4.8이 소규모 엔지니어링 팀이 수행하던 작업을 오케스트레이션 (orchestrate)할 수 있게 해줍니다.
요약하자면, 이 기능의 역량은 다음과 같습니다:
- 모델이 작업을 계획합니다.
- 작업의 각 부분을 실행하기 위해 수십 또는 수백 개의 병렬 서브에이전트 (subagents)를 생성합니다.
- 다른 에이전트들이 결과가 보고되기 전에 적대적으로 (adversarially) 그 발견 사항을 반박하려고 시도합니다.
- 상태가 체크포인트 (checkpointed)로 저장되므로, 작업이 중단되어도 유지되며 며칠에 걸친 실행 과정에서도 재개할 수 있습니다.
- 조정 (Coordination)은 대화 스레드 외부에서 이루어지므로, 메인 세션의 응답성을 유지할 수 있습니다.
Anthropic이 제시하는 사용 사례는 다음과 같습니다:
- 코드베이스 전반의 버그 탐색 및 데드 코드 (dead-code) 발견.
- 보안 및 하드닝 (hardening) 감사.
- 대규모 마이그레이션 (migrations): 프레임워크 교체, 언어 포팅 (language ports), API 폐지 (deprecations).
- 독립적인 시도와 적대적 검토자 (adversarial reviewer)를 모두 원하는 검증 중심의 작업.
전형적인 사례 연구는 Jarred Sumner가 실행한 Bun의 Zig-to-Rust 포팅입니다. 750,000줄의 Rust 코드가 생성되었고, 테스트 스위트 (test suite)의 99.8%가 통과되었으며, 첫 커밋부터 머지 (merge)까지 11일이 소요되었습니다. 워크플로는 먼저 수명 주기 (lifetime) 요구 사항을 매핑한 다음, 병렬 작성기 (parallel writers)가 파일당 두 명의 검토자를 배치하여 모든 .rs 파일을 생성했으며, 밤샘 수정 루프 (fix loop)를 통해 데이터 복사 최적화 문제를 해결했습니다. 이것은 벤치마크 (benchmark)가 아닌 실제 결과입니다.
활성화 (Activation)
Claude Code 내부에서 다음 세 가지 방법 중 하나로 기능을 켤 수 있습니다:
- Claude Code에서 자동 모드 (auto mode)를 활성화합니다.
- 명시적으로 요청합니다: "워크플로를 생성해줘 (create a workflow)."
- 노력 (effort) 수준을
xhigh로 설정하는ultracode설정을 토글합니다.
첫 번째 트리거 시에는 미리보기가 표시되며 확인이 필요합니다. 동적 워크플로는 Max, Team, Enterprise (관리자 활성화 시) 및 API를 통해 사용할 수 있습니다.
토큰 비용 경고 (Token Cost Warning)
워크플로는 표준 세션보다 훨씬 더 많은 토큰을 소비합니다. 운영 환경에서 이 기능을 켜기 전에 예산을 계획하십시오. 며칠 만에 분기 분량의 업무를 끝내주는 동일한 기능이, 주의를 기울이지 않는다면 동일한 기간 동안 분기 분량의 토큰을 소비할 수도 있습니다.
정직성, 신뢰성, 그리고 정렬 (Alignment)
이 부분은 벤치마크 표에 깔끔하게 나타나지는 않지만, 에이전트 (Agents)를 배포하는 모든 이들에게 가장 중요한 이번 출시의 핵심 요소입니다.
코드 정직성 (Code Honesty)
- 4배 감소: Opus 4.7 대비 보고되지 않은 코드 결함 (Code flaws) 발생률이 4배 감소했습니다.
- 코드 요약 정직성 (Code summary honesty): 중요한 이벤트를 놓치는 비율이 단 3.7%에 불과합니다.
- 결함이 있는 결과를 무비판적으로 보고하는 행위: 0%. 해당 테스트에서 0점을 기록한 최초의 Claude 모델입니다.
- 과잉 확신 (Overconfidence): Opus 4.7 대비 10배 이상의 개선을 이루었습니다.
- 게으른 조사 (Lazy investigation): 완벽한 점수를 기록했습니다. 동일한 조사에서 Opus 4.7은 25%의 확률로 잘못된 답변을 내놓았습니다.
이 지표들을 하나의 흐름으로 읽으십시오. Opus 4.8은 실제 문제를 덮어버리면서 자신감 있게 들리는 요약본을 건네줄 가능성이 현저히 낮아졌습니다. Anthropic의 출시 보도에 포함된 Bridgewater Associates의 추천사에서는
- 세션 중간에 도구 권한 (tool permissions) 조정.
- 계획 단계 (planning step) 이후 토큰 예산 (token budget) 재할당.
- 전체 대화를 재시작하지 않고 환경 컨텍스트 (environment context) 주입 (예: 사용자가 방금 리포지토리를 전환했거나, 오래 실행 중인 작업이 완료된 경우).
장시간 실행되는 에이전트 워크플로 (agentic workflows)의 경우, 이 단일한 변화는 들리는 것보다 훨씬 더 유용합니다.
Opus 4.8과 업계 모델의 비교
현재 4.8이 어느 위치에 있는지에 대한 짧은 분석입니다:
vs. GPT-5.5:
- Opus 4.8은 SWE-bench Pro (69.2% vs 58.6%)에서 앞서며, GDPval-AA ELO에서 약 121점 차이로 앞서고 있습니다.
- GPT-5.5는 여전히 Terminal-Bench 2.1 (78.2% vs 74.6%)에서 앞서고 있습니다.
vs. Gemini 3.1 Pro:
- Opus 4.8은 SWE-bench 변형 모델들과 긴 컨텍스트 검색 (long-context retrieval)에서 앞서고 있습니다.
- Gemini 3.1 Pro는 GPQA Diamond (94.3% vs 93.6%)와 여러 다국어 작업 (multilingual tasks)에서 앞서고 있습니다.
이 수치들을 다음과 같이 해석할 수 있습니다: "Opus 4.8은 현재 가장 강력한 에이전트 코딩 모델이지만, 다국어 및 터미널 하네스 (terminal-harness)에서의 승리가 보편적인 것은 아니다."
정직한 평가: 강점과 한계
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기
