Grok 4.7, VulcanBench Frontier v4에서 상위 3개 자리를 차지하며 Fable 5.1, Opus 5.5, GPT-6
요약
Grok 4.7 모델이 VulcanBench Frontier v4 벤치마크에서 상위 3개 자리를 차지하며 Fable 5.1, Opus 5.5, GPT-6 등 최신 선도 모델들을 능가하는 성과를 보여주었습니다. 이 벤치마크는 단순 코드 생성을 넘어 레포지토리 수준의 소프트웨어 엔지니어링 작업을 테스트합니다.
핵심 포인트
- Grok 4.7이 VulcanBench Frontier v4에서 상위 3개 자리를 차지했습니다.
- 해당 벤치마크는 복잡한 저장소(repository)-레벨 소프트웨어 엔지니어링을 평가합니다.
- 모델들은 레거시 코드 재구축 및 기능적 정확성을 검증받았습니다.
Grok 4.7이 VulcanBench Frontier v4에서 상위 3개의 자리를 차지하며 Fable 5.1, Opus 5.5, GPT-6 Astra, GPT-6.1 Sol 및 기타 선도적인 최전선(frontier) 모델들을 능가했습니다.
• Grok 4.7 xHigh - 93.15
• Grok 4.7 High - 92.71
• Grok 4.7 Medium - 92.30
VulcanBench Frontier v4는 AI 모델이 단순히 고립된 코드 스니펫을 생성하는 것이 아니라, 어려운 저장소(repository)-레벨 소프트웨어 엔지니어링 작업을 처리할 수 있는지 테스트합니다.
이 벤치마크에는 모델들이 레거시 소프트웨어를 실제 동작에 맞게 재구축해야 하는 23개의 행동 재구성(behavioural-reconstruction) 작업이 포함되어 있으며, 기능적 정확성(functional correctness)은 보안, lint/복잡도, 코드 품질과 함께 숨겨진 테스트를 통해 검증됩니다.
그리고 과제 결과 또한 매우 인상적입니다:
• Grok 4.7 xHigh - 23/23 통과
• Grok 4.7 High - 22/23 통과
• Grok 4.7 Medium - 21/23 통과
Grok 4.7이 #1, #2, #3 자리를 모두 차지했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: Benchmark의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기