Grok 4.7 출시: 더 강력한 코딩 능력과 장기 실행 에이전트 기능 제공
요약
SpaceXAI가 새로운 버전인 Grok 4.7을 출시했습니다. 이 모델은 코딩 능력과 장기 실행 에이전트 기능, 지식 작업 능력이 크게 향상되었습니다. 특히 CursorBench와 Terminal-Bench 등 여러 벤치마크에서 이전 버전을 뛰어넘는 성능 개선을 보여주었습니다.
핵심 포인트
- 코딩 및 에이전트 기능 강화: 장시간 RL 학습 기반의 대규모 모델로 발전했습니다.
- 다양한 벤치마크 우위 확보: CursorBench, Terminal-Bench 등 여러 테스트에서 경쟁 모델 대비 성능 향상을 입증했습니다.
- 안전장치 개선: 탈옥 저항성을 높이면서도 합법적 작업에서의 거절을 줄였습니다.
- 접근성 및 가격 경쟁력: 기존과 동일한 가격/속도로 강력해진 기능을 제공합니다.
Grok 4.7이 공개되었습니다. @SpaceXAI의 최신 버전은 Grok 4.6과 동일한 가격 및 속도로 더욱 강력해진 코딩, 장시간 구동되는 에이전트, 그리고 향상된 지식 작업 능력을 가져왔습니다.
가장 큰 개선점:
• 몇 시간까지 걸릴 수 있는 더 어려운 작업을 통해 긴 기간의 강화학습(RL)으로 훈련된 대규모 기반 모델.
• 향상된 자체 검토 및 긴 컨텍스트 처리 능력.
• 문서 및 프레젠테이션 생성 기능 개선.
• 보다 나은 대화와 일반 지식 작업을 위한 Grok Bot harness에 대한 네이티브 이해.
• 더 강력한 탈옥(jailbreak) 저항성과 합법적인 사이버 보안 작업에 필요한 불필요한 거절을 줄인 재구축된 안전장치 시스템.
공개 벤치마크 결과는 4.6 버전에 비해 의미 있는 향상을 보여줍니다:
• CursorBench 4.0: 40.4% → 46.3%
• Terminal-Bench 4.0: 20.3% → 38.0%
• EEBench: 53.0% → 64.0%
• Harvey Legal Agent Benchmark: 15.8% → 19.6%
• GDPval: 1,605 → 1,695 Elo
경쟁 모델 대비 Grok 4.7은 CursorBench와 Terminal-Bench에서 GPT-5.6 Sol을 능가하며, EEBench와 Harvey에서는 Sol 및 Fable 5.1 모두를 앞섭니다. 다만, Fable이 여전히 CursorBench, Terminal-Bench, 그리고 GDPval에서 선두를 유지하고 있습니다. 강력한 발전세를 보였으며, 특히 매력적인 가격 대비 성능을 자랑합니다.
가격은 입력 토큰당 $2, 출력 토큰당 $6부터 시작합니다. 빠른 버전(fast variant)은 두 배의 속도로 출력을 제공하며 가격은 두 배입니다.
현재 Cursor, Grok Build 및 API를 통해 이용 가능합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: AI 도구/개발의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기