Grok 4.7
요약
Grok 4.7은 코딩 및 지식 업무에 특화된 모델로, 이전 버전 대비 성능이 크게 향상되었습니다. 특히 CursorBench 4.0에서 46.3%를 기록하며 전문적인 코딩 능력을 입증했습니다. 또한, 동급 모델 대비 빠른 속도와 합리적인 가격으로 제공되어 실용성이 높습니다.
핵심 포인트
- 코딩 및 지식 업무에 최적화된 성능 개선
- CursorBench 4.0에서 이전 모델 대비 28.1% 향상 (46.3%)
- 전문 분야(법률, 전기공학 등)에서 최고 수준의 점수 기록
- 빠른 속도와 합리적인 가격으로 접근성 강화
- 코딩과 지식 업무용
Grok 4.7은 어려운 작업을 더 오래 수행하고, 자체 검증과 긴 컨텍스트 관리를 개선했으며Grok 4.6과 같은 가격과 속도로 제공됨 - 더 큰 기반 모델에
수 시간이 걸리는 어려운 과제 중심의 강화학습을 더 오래 적용하고, Grok Bot의 실행 환경에 맞춰 대화와 일반 업무 수행 능력을 높임 - 장시간 코딩 과제를 평가하는
CursorBench 4.0에서 46.3%로 이전 모델의 40.4%보다 향상됐으며, 문서와 프레젠테이션 작성 등 전문 업무 성능도 개선됨 - 새로운 안전장치를 적용해 악의적인 요청과 탈옥에 대한 저항성을 높였으며, 자체 보안 평가에서는
위험한 요청을 거부하면서 정상적인 보안 업무는 드물게 차단함 Cursor, Grok Build, Grok API등에서 이용 가능하며, 입력/출력 100만 토큰당2달러/6달러부터시작하고 출력 속도와 가격이 각각 2배인 고속 버전도 제공
코딩과 지식 업무 성능 개선
Grok 4.7은 SpaceXAI의 코딩과 지식 업무용 모델로,동급 모델 대비 2배 빠른 속도와 절반 가격을 앞세움- Grok 4.6보다 더 큰 기반 모델을 사용하고,
완료에 수 시간이 걸리는 어려운 과제에 비중을 두어 강화학습을 더 오래 진행함- 어려운 작업을 더 오래 이어가고, 자신의 결과를 검증하며, 긴 컨텍스트를 관리하는 능력을 개선함
- Grok Bot의 에이전트 실행 환경인
하네스를 이해하도록 학습해 대화와 일반 지식 업무 수행 능력도 높임
문서와 프레젠테이션 작성에서도 이전 모델보다 개선됨- 변호사, 간호사, 재무 분석가 등의 전문 업무를 평가하는 GDPval과 AA Briefcase에서 Grok 4.6을 앞서며, 다른 최상위 모델과 비슷한 성능을 보임
- 별도 비교 차트에서는 GPT-6 Astra와 Fable 5.1 등을 대상으로 전문 지식 업무, 사무 업무, 전기공학 성능을 비교함
주요 벤치마크
- 공개 비교에서
CursorBench 4.0은 40.4%에서 46.3%,**Terminal-Bench 4.0은 20.3%에서 38.0%*로 이전 모델보다 향상됨 - 전기공학과 법률 업무 평가에서는 아래 비교 모델 중 가장 높은 점수를 기록함
평가 Grok 4.7 xHigh Grok 4.6 High GPT-5.6 Sol Max Fable 5.1 Max 코딩: CursorBench 4.0 46.3% 40.4% 41.7% 51.8% 코딩: DeepSWE v1.1 71.0% 65.2% 72.7% 70.0% 전기공학: EEBench 64.0% 53.0% 39.4% 56.4% 수 시간 사무 업무: AA Briefcase v1.1 1,657 1,546 1,487 1,678 수 시간 터미널 업무: Terminal-Bench 4.0 38.0% 20.3% 37.3% 57.9% 법률: Harvey Legal Agent Benchmark 19.6% 15.8% 2.5% 6.7% 임상 추론: HealthBench Professional 56.7% 48.5% 60.5% 62.1% - SpaceXAI가 공개한 수치이며, Grok 4.7의
DeepSWE 점수만 High 설정에서 측정함
위험한 요청을 거부하면서 정상적인 보안 업무는 허용
-
새로운
안전장치 체계를 적용했으며, 개발사 내부 테스트에서 자사 모델 중 위험한 요청 거부와 탈옥 저항성이 가장 높았음 - 사이버 보안과 생물학처럼 유익한 용도와 위험한 용도가 공존하는 분야에서
정상적인 작업 수행과 위험한 요청 차단을 함께 개선함- 공개 평가에서
**LatchBio 생물안전 벤치마크 62.4%**로 최고 점수를 기록함 - 자체 평가인
HackerBench v0.3에서는 위험한 이중 용도 프롬프트의 3.3%만 허용하면서, 정상적인 보안 업무는 드물게 차단함 -
공개 평가에서
-
일부 사이버 보안 파트너에게는 방어 연구를 위한
레드팀 기능을 초대 방식으로 제공하기 시작함
가격과 이용 방법
- 출시 당일부터 Cursor, Grok Build, Grok API와 외부 코딩 하네스, 모델 라우터, 클라우드 플랫폼에서 이용 가능
- 기본 가격은
입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러부터시작하며, Grok 4.6과 가격과 속도가 같음모델 입력 100만 토큰 출력 100만 토큰 Grok 4.7 $2 $6 Grok 4.6 $2 $6 GPT-5.6 Sol $4 $20 Fable 5.1 $10 $50 - 위 가격은 발표문에 제시된 비교 기준이며, 별도로
출력 속도와 가격이 각각 2배인 고속 버전도 제공 Grok Build에서 무료 체험가능
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기