Claude Opus 5, Artificial Analysis 지능 리더보드 1위
요약
Artificial Analysis의 지능 리더보드 결과를 분석하며, 단일 지표 중심의 순위보다는 작업 복잡도와 비용, 속도에 따른 모델 선택의 중요성을 강조합니다. Claude Opus 5와 GPT-5.6 Sol Max 등 주요 모델의 성능과 지식 신뢰성 지표를 비교 분석합니다.
핵심 포인트
- 단일 지표 순위보다 작업별 강점과 약점에 따른 모델 선택이 중요함
- Claude Opus 5와 GPT-5.6 Sol Max의 지능 및 비용 효율성 비교
- 지식 신뢰성과 환각을 측정하는 AA-Omniscience Index의 유용성
- Google Gemini 모델의 지식 작업 분야에서의 뛰어난 성능 확인
이 순위표는 최종 사용자가 어떤 모델을 언제 쓸지 결정하는 데 사실상 무의미해졌음
모델마다 특정 분야와 작업에서 강점과 약점이 달라 단일 지표 순위는 쓸모가 없고, 이제는 ‘최고의 모델’ 하나도 없으며 작업 복잡도에 따라 최고 모델이 필요하지 않을 수도 있음
예컨대 UI 디자인에는 Fable, 백엔드 시스템 설계에는 Sol, 취약점 개발에는 Kimi K3를 쓸 수 있으며, 이런 지표는 결국 모델 회사의 과시용 숫자에 가까움
1년 전 새 ‘최고 모델’이 나와 기대하며 파일 3개를 사소하게 수정하는 간단한 프로그래밍 작업을 시켰고 잘 처리했음
그런데 같은 계열의 더 오래되고 작은 모델도 잘 처리하면서 3배 빠르고 비용은 9분의 1이었고, 그 순간 깨달음을 얻었음
기술 스택별 벤치마크가 있으면 좋겠음
2026년에 Elixir/Phoenix 프로젝트를 가장 관용적인 방식으로 잘 처리하는 모델이 무엇인지처럼 다소 주관적이더라도, 모든 모델을 계속 직접 비교하기 어렵고 성능 차이도 큰 상황에서는 유용할 수 있음
‘완전히 무의미하다’거나 ‘유일한 목적’이라는 표현은 과장임
모든 통계에 왜곡은 있지만 아무것도 모르는 것보다는 낫고, 벤치마크가 여러 작업의 평균을 보여준다는 건 통계가 본래 요약을 위한 것이라는 뜻임
링크를 열어 보면 단일 지표만 있는 게 아니라 판단에 필요한 모든 지표가 실제로 제공됨
Artificial Analysis의 작업당 비용이나 환각 발생 빈도 같은 차트에는 가치가 있음
다만 이를 하나의 결과로 합치면 모든 미묘한 차이가 사라지고 과시용 순위만 남음
Google 경영진이라면 일이 많아서뿐 아니라 사람들 앞에 보이기 부끄러워서 사무실에서 자야 하는 것 아닌가 싶음
보조금을 태우며 손해 보지 않는 유일한 업체라서 오히려 편히 잘 수 있음
Google은 가장 지능적인 AI보다 모든 제품에서 수익화할 수 있는 속도를 더 중시하는 듯함
오래전부터 질문에 정확한 답을 가장 빠르게 제공하는 것이 최우선이라고 밝혀 왔음
Google이 OpenAI나 Anthropic처럼 지능을 극대화한 모델로 경쟁하려는지도 의문임
셋 중 AGI를 숭배하며 고행하지 않는 유일한 회사처럼 보임
Gemini 모델도 여러 부문에서 선두이거나 선두권이라, 부끄러울 만큼 뒤처졌다는 결론은 맞지 않아 보임
지능 지수 상위권은 Claude Opus 5 Max 61점, Opus 5 Xhigh 60점, Claude Fable 5 Max와 Opus 4.8 대체 모델 조합 60점, GPT-5.6 Sol Max 59점, Opus 5 High 59점임
따라서 Opus 5 Xhigh가 Sol Max보다 높고, Opus 5 High는 Sol Max와 같으니 두 모델의 가격과 속도 차이가 궁금함
Artificial Analysis의 작업당 지능 대비 비용과 시간 그래프에서는 Opus 5 High와 Sol Max의 비용·시간이 대략 비슷함
DeepSwe에서는 Opus 5가 Fable을 이기지만 Sol에는 밀리며, FrontierCode에서는 모두 압도하다가 추론 노력을 Medium보다 높이면 Sonnet 수준으로 급락함
Opus 5는 Sol Max만큼 지능적이지 않고 일부 작업에서는 Opus 4.8보다도 못해 보임
특히 피상적으로 접근해 앱이나 프레임워크 전체를 가르쳐 줘야 하며, 이미 다른 형태로 지원되는 기능을 또 추가하는 식의 어리석은 작업부터 시작함
구성 요소 중 AA-Omniscience Index가 흥미로움
지식 신뢰성과 환각을 측정해 정답에는 보상하고 환각에는 감점하지만 답변 거부에는 감점하지 않으며, 매개변수 규모나 밀도를 대략 보여주는 지표처럼 보임
순위는 Claude Fable 5 대체 모델 조합, Gemini 3.1 Pro Preview, Claude Opus 5 Max, Grok 4.6 High, Gemini 3.6 Flash, GPT-5.6 Sol Max 순이며, Gemini 3.x에서는 오래전부터 대형 모델 특유의 느낌이 났음
Gemini 3.1 Pro는 지식 작업에 매우 뛰어나고 Google이 이 부분을 잘 해냈음
Gemini 3.6 Flash의 이미지 분석도 탄탄하지만 코딩이나 에이전트 작업에서는 부족함
3.6 Flash가 24점으로 Sol의 22점보다 높은 걸 보면 매개변수 규모의 대리 지표인지는 확신하기 어려움
3.x Flash는 단일 TPU 8i에 들어간다고 알려졌고 처리 속도도 234.7토큰/초로 Sol의 64.4, Opus의 56.3보다 압도적이며, 3.1 Pro도 113.9토큰/초로 훨씬 빠름 AA-Omniscience Accuracy는 초대형 Fable이 61%로 선두이고 Sol, GPT-5.5, Opus 같은 대형 최전선 모델이 뒤따라 예상에 더 부합함
Gemini는 코딩 최고점보다 일반 지식과 운영비 효율에 집중한 듯하며, 정규화된 분야별 점수에서는 소프트웨어만 경쟁력이 떨어짐
답변 거부에 감점하지 않는다면 그다지 유용하지 않음
모델 규모보다 근거 연결(grounding) 의 영향이 같거나 더 클 수 있으며, Google은 분명한 이유로 이 부분을 매우 잘함
Max는 추가 추론량이 매우 많으므로 High에서는 해결하는 작업이 얼마나 줄어드는지 궁금함
비용은 상당히 낮아질 듯함
Meta Muse Spark를 새롭게 보게 됐음
어느 하나에서 최고는 아니지만 순위표 곳곳의 적정 지점에 자리하며 비용과 성능의 균형이 좋음
목록에 없는 Poolside Laguna S의 위치도 궁금하며, 개인적으로는 잘 작동하면서 비용 효율적인 모델에 관심이 큼
박빙의 1위라도 검열을 뜻하는 ‘안전장치’가 답변을 거부하거나 다른 모델로 낮추지 않도록 조심해야 한다면 효용이 크게 떨어짐
이 때문에 기존 작업 흐름 일부를 빼면 Claude 사용을 거의 중단했으며, 61점과 57점 차이보다 신뢰성이 중요함
검열과 본인이 직접 겪지는 않은 신원 확인까지 고려하면 Claude는 가장 훼손되고 불안정한 모델이며, 최신 버전의 미미한 벤치마크 최적화는 그만한 가치가 없음
어떤 질문을 하기에 그렇게 자주 검열에 걸리는지 궁금함
직접 써 본 바로는 벤치마크만 노린 모델이 전혀 아님
모든 모델에 게임 제작 시험을 적용하는데 Opus 5는 세대가 바뀐 수준의 도약처럼 느껴졌고, 벤치마크는 정확한 모습을 보여주지 못하므로 직접 시험해야 함
온라인에서 한도나 모델이 개선됐다는 얘기를 보고 Anthropic에 절대 돈을 내지 않겠다는 원칙을 재검토할 때마다 모델 카드를 확인하고 오히려 확신이 강해짐
Anthropic이 왜 자동·무음 하향 전환에 그토록 집착하는지 모르겠고, 답변 거부 대신 자동으로 성능을 낮추길 원하는 사용자가 한 명이라도 있는지 의문임
Claude Opus 5.0에 시험 환경의 PaaS에서 전역 API 키로 웹 앱을 배포하고 데이터를 가져오라고 했더니, 권한이 넓다는 보안 문제를 이유로 거부했음
같은 작업을 Opus 4.5~4.8과 Fable, Codex 5.4·5.5, Sol 5.6은 문제없이 처리했음 Opus 5는 지나치게 조심스러워 생산적으로 쓰기 어렵고 추가 조정이 필요함
어쩌면 의미 있는 일을 하지 않아서일 수 있으며, Terence Tao는 ‘깨어 있는 AI 모델’ 때문에 불평하지 않음
Opus 5가 4.8처럼 모든 것을 다시 설명하지 않아 좋음
GPT-5.6 Sol은 사소한 일에도 지나치게 깊게 추론하는 반면 Opus 5는 훌륭한 모델이며 Anthropic이 잘해냈음
Sol에 구현 명세를 줬을 때는 매우 잘 처리해서 이 차이를 몰랐음
명세 없이 알아서 하라고 하자 2시간 30분 동안 주간 사용량의 30%를 썼지만, 명세를 주면 30분 동안 2%만 사용했고 결과도 구조·길이·검증·범위·비용 모두 더 나았음
Sol을 내버려 두면 통제 불능이 되므로 이제 Sol이 명세를 작성하고 Terra가 구현하게 하며, 이 방식이 잘 작동하고 전체 사용량도 줄었음
더 흥미로운 결과는 Opus 5가 Fable 5 다음으로 압도적으로 비싼 모델이라는 사실임
GPT-5.6과 Kimi K3는 절반의 비용으로 1~2% 차이의 비슷한 점수를 냄
차트는 가격에 민감하지 않은 기업 사용자가 주로 쓰는 Max 추론 노력을 기준으로 함
Medium에서는 비용이 K3의 거의 절반까지 내려가고, 코딩 작업의 95%에는 충분할 가능성이 큼
어느 편도 아니지만 이 결과에서는 GPT-5.6 Sol Max가 더 좋아 보임
거의 같은 성능을 절반가량의 비용으로 제공하며, Opus 5도 GPT-5.6보다 이렇게 비싼 걸 보면 Fable의 가격이 얼마나 높은지 드러남
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기