
Claude Opus 4.8 출시. 내가 모델을 교체하는 이유는 벤치마크 때문이 아니다.
요약
Anthropic의 Claude Opus 4.8 출시 소식과 함께, 단순 벤치마크 수치보다 중요한 모델의 '조정된 정직함(calibrated honesty)'에 대해 다룹니다. Opus 4.8은 코드 결함을 묵인하지 않고 불확실성을 선제적으로 지적함으로써 에이전트 작업 시 발생하는 침묵하는 실패를 줄이는 데 집중했습니다.
핵심 포인트
- Opus 4.8은 SWE-Bench Pro 및 Reasoning 분야에서 압도적 성능 기록
- 단순 성능보다 모델의 불확실성 지적 능력이 에이전트 활용의 핵심
- 코드 결함을 묵인하지 않고 엣지 케이스를 선제적으로 제안하는 능력 향상
- Terminal-Bench 2.1에서는 GPT-5.5에 비해 다소 낮은 성능 기록
Anthropic이 오늘 Claude Opus 4.8을 출시했습니다. 벤치마크 수치는 늘 그렇듯 상승했습니다. 하지만 제가 기본 모델을 교체하는 이유는 그것 때문이 아니며, 실제로 제 작업 방식을 바꾼 부분에 대해 설명하고자 합니다.
수치 요약
공식 비교 결과는 다음과 같습니다:

주요 하이라이트:
- SWE-Bench Pro: 69.2% — 4.7 버전의 64.3%에서 상승했으며, GPT-5.5 (58.6%)와 Gemini 3.1 Pro (54.2%)를 크게 앞섭니다.
- Computer use (OSWorld-Verified): 83.4% — 실제 UI를 클릭하며 조작하는 능력에서 여전히 극복해야 할 기준이 되는 모델입니다.
- Knowledge work (GDPval-AA): 1890 (GPT-5.5의 1769 대비).
- Reasoning (Humanity's Last Exam): 도구 미사용 시 49.8% / 도구 사용 시 57.9% — 표의 최상단에 위치합니다.
그리고 솔직하게 언급할 부분이 있습니다: Terminal-Bench 2.1에서 Opus 4.8은 74.6%를 기록했으며, GPT-5.5가 78.2%로 승리했습니다. 4.8은 이전 버전(66.1%)보다 크게 도약했지만, 해당 항목에서 1위는 아닙니다. 여러분이 실제로 하는 작업에 맞춰 모델을 선택하십시오.
어떤 벤치마크보다 더 중요한 부분
Opus 4.8은 4.7에 비해 코드 결함을 지적하지 않고 그대로 통과시킬 확률이 약 4배 낮습니다. 이 모델은 불확실성을 선제적으로 지적하고, 모호한 입력값에 의문을 제기하며, 타당하지 않다고 판단되는 계획에 대해 반론을 제기합니다.
작게 들릴 수도 있지만, 그렇지 않습니다.
에이전트(Agent)에게 작업을 맡길 때, 진짜 병목 현상은 단순한 성능(Raw capability)이 아니라 _침묵하는 실패(Silent failure)_였습니다. 미묘한 'off-by-one' 오류를 작성하고도 아무 말도 하지 않는 모델은, 성능은 약간 떨어지더라도 "이 입력값이 절대 non-null이 아닐 수도 있는데, 확인해 주시겠어요?"라고 말하는 모델보다 더 큰 비용을 발생시킵니다.
구체적으로는 다음과 같습니다:
이전: 깔끔해 보이는 함수를 작성하고, 숨겨진 엣지 케이스(Edge-case) 버그를 포함한 채 아무 말 없이 배포합니다. 당신은 이를 운영 환경(Production)에서 발견하게 됩니다.
이후: 동일한 함수를 작성하면서 "여기에 제가 확신하지 못하는 엣지 케이스가 있습니다. 입력값이 비어 있지 않은지 다시 확인해 주세요"라고 덧붙이거나, 당신의 계획에 허점이 있다고 단도직입적으로 말해줍니다.
Claude를 아무런 감독 없이 결과물을 제출하는 동료로 대하는 사람이라면, 그 조정된 정직함(calibrated honesty)은 몇 점의 벤치마크 점수보다 더 가치 있습니다.
알아둘 만한 세 가지 제품 변경 사항
- Dynamic Workflows (Claude Code research preview) — 수십만 줄에 달하는 코드베이스를 마이그레이션하는 것과 같은 대규모 작업을 위해 수백 개의 병렬 서브 에이전트(subagents)를 실행합니다.
- Effort control (claude.ai, Cowork) — 모델이 얼마나 깊게 생각할지를 직접 선택합니다. 높을수록 더 깊게(deeper), 낮을수록 더 빠르게(faster) 작동합니다. 속도와 품질 사이의 트레이드오프(trade-off)를 다시 사용자의 손에 맡긴 것입니다.
- Messages API가 이제 프롬프트 캐시(prompt cache)를 깨뜨리지 않고 배열 중간에
system항목을 수락합니다 — 긴 작업 중간에 새로운 지침을 주입하면서도 캐시를 유지할 수 있습니다. 장기 실행 에이전트(long-running agents)를 구축하고 있다면, 이것이 왜 중요한지 이미 알고 계실 것입니다.
가격 변동 없음
- 일반 모드: 입력 1M당 $5, 출력 1M당 $25 — 4.7 버전과 동일합니다.
- 빠른 모드(Fast mode): 입력 1M당 $10, 출력 1M당 $50 — 이전 빠른 티어(fast tier)보다 3배 저렴하며, 더 작은 모델이 아닌 여전히 Opus 모델입니다.
Databricks는 자사의 워크로드에서 4.7 대비 토큰 비용이 61% 낮아졌다고 보고했습니다. 이는 4.8이 도구(tools)를 더 효율적으로 사용하고 더 적은 단계(steps)를 거치기 때문입니다.
모델 ID는 claude-opus-4-8이며, 오늘부터 모든 곳에서 사용할 수 있습니다.
나의 견해
에이전트(agents)의 다음 해자(moat)는 IQ가 아닙니다. 그것은 바로 조정된 정직함(calibrated honesty)입니다. 자신이 확신할 수 없을 때를 알려주는 모델이야말로 실제로 업무를 위임할 수 있는 모델입니다. 이것이 바로 제가 이번 업데이트에서 중요하게 생각하는 부분입니다.
숫자와 이미지는 Anthropic의 발표 자료에서 가져왔습니다. 전체 평가(evals) 결과는 시스템 카드(system card)에 포함되어 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기