
Grok 4.5 출시: 최강이 아닌, 가장 가성비 좋은 프론티어(Frontier)
요약
xAI가 가성비를 극대화한 Grok 4.5를 출시했습니다. 이 모델은 최상위 성능보다는 코딩과 에이전트 작업에 특화된 효율적인 프론티어 모델을 지향하며, 경쟁 모델 대비 매우 저렴한 가격을 강점으로 내세웁니다.
핵심 포인트
- 프론티어급 성능을 경쟁 모델 대비 약 1/5 가격으로 제공
- 코딩 및 에이전트 작업에 특화된 학습 데이터 활용
- 도구 사용(Tool Use) 및 실무 태스크 지표에서 세계 1위 기록
- 정직성(Honesty) 벤치마크 하락 및 안전 문서 미공개 문제 존재
머스크의 xAI가 Grok 4.5를 조용히 출시했습니다. "지금까지 중 가장 고성능"이라고 내세우며, grok.com, X, iOS/Android 앱에서 이용 가능합니다. 하지만 수치를 살펴보면, Grok 4.5가 노리는 것은 "최강"이 아닙니다. 다른 포지션——**가장 가성비 좋은 "프론티어 (Frontier)"**입니다.
제3자 기관인 Artificial Analysis의 지능 지수에서, Grok 4.5는 54점, 전체 4위를 기록했습니다. Claude Fable 5, GPT-5.5, Opus 4.8의 뒤를 잇고 있습니다. 즉, "가장 고성능"이라는 말은 업계 전체로 보면 마케팅 용어이며, Top 3에는 들지 못했습니다.
진정한 승부처는 가격입니다. 100만 토큰당 입력 $2 / 출력 $6——Opus 4.8이나 Fable 5의 약 5분의 1 수준이며, 게다가 **50만 토큰의 컨텍스트 길이 (Context Length)**를 제공합니다. 이를 종합해 보면 목표는 명확합니다: "점수가 가장 높은가"가 아니라, "프론티어에 근접한 성능을 프론티어의 5분의 1 가격으로 제공하는 것"입니다. 왕좌가 몇 달마다 바뀌는 시대에, "충분히 강력하면서도 충분히 저렴함"은 실제로 비용을 지불하며 사용하는 사용자들에게 "최강"보다 더 매력적으로 다가옵니다.
Grok 4.5의 핵심은 범용 채팅 모델이 아니라, 코딩과 에이전트 (Agent) 작업에 특화되어 만들어졌다는 점입니다. 실제 Cursor 개발자 세션 데이터로 훈련되었습니다. 즉, "인터넷상의 코드 형태"를 배우는 것이 아니라, "프로그래머가 실제 프로젝트에서 어떻게 단계별로 업무를 진행하는지"를 학습했습니다.
결과 또한 이를 뒷받침합니다:
Terminal-Bench 2.1: 83.3%, SWE-Bench Pro: 64.7% —— 둘 다 실제 코드베이스에서의 장시간 작업 지표입니다. -
에이전트의 도구 사용 (Tool Use): 세계 1위; -
Harvey의 법무 에이전트 기준: 1,200건 이상의 실무 법무 태스크에서 1위.
시그널은 다음과 같습니다: 프론티어 모델은 "무엇이든 말하는 모델"에서 "특정 실무에서 비정상적으로 유능한 모델"로 분화되고 있습니다. Grok 4.5가 선택한 가장 가치 있는 레인은 바로 코딩 + 에이전트입니다.
칭찬할 점 외에 무시할 수 없는 두 가지 문제가 있습니다:
정직성(Honesty)의 후퇴 —— 정직성 측면에서 **벤치마크상의 후퇴 (Honesty Regression)**가 나타났습니다. 즉, 경우에 따라 그럴듯하게 이야기를 지어내는(환각) 경향이 더 쉬워질 수 있습니다. -
안전 문서 없음 —— xAI는 안전 문서(Safety Document)를 전혀 공개하지 않았습니다.
특히 두 번째 문제는 최근 프론티어 모델 발표에서 공통적으로 나타나는 패턴입니다 (Kimi K3에도 시스템 카드(System Card)가 없었던 것을 기억하시나요). 코드를 작성하고, 도구를 호출하며, 에이전트 작업을 수행하는 강력한 모델이 안전 공개 없이 수억 명에게 배포되는 것—그 자체로 하나의 시그널입니다.
단일 모델로 보면 Grok 4.5는 "또 하나의 신모델"일 뿐입니다. 하지만 지난 반년의 맥락에서 보면 두 가지 사실을 뒷받침합니다.
첫째, 프론티어 성능이 급격히 범용화(Commodity)되고 있습니다. "Opus 급의 코딩 성능"이 5분의 1 가격이 된다면, 경쟁은 "누가 최강인가"에서 "당신의 구체적인 용도에 있어 누가 강하고 저렴한가"로 옮겨갑니다.
둘째, "안전 카드 없음"이 상시화되고 있습니다. Kimi K3부터 Grok 4.5에 이르기까지, 안전 공개를 생략하고 출시하는 강력한 모델이 늘어나고 있습니다. 이는 우연이 아니라 트렌드입니다.
교훈은 동일합니다: 어떤 모델에도 올인하지 마십시오. 왕좌는 몇 달마다 바뀝니다. 현명한 사용법은 언제든 즉시 전환할 수 있는 상태를 유지하는 것입니다. 강하고 저렴하며 용도에 맞는 것을 그때그때 사용하는 것 말입니다. Grok 4.5는 그 사실을 다시 한번 상기시켜 줄 뿐입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기