
속보: Grok 4.5가 VulcanBench의 새로운 코딩 벤치마크를 선도하다.
요약
Grok이 새로운 코딩 벤치마크인 VulcanBench에서 높은 점수를 기록하며 성능을 입증했습니다. Grok은 다섯 가지 언어의 23개 소프트웨어 작업 중 21개를 해결하여 Claude Fable 5와 GPT-5.6 Sol 같은 경쟁 모델들을 능가하는 성과를 보였습니다.
핵심 포인트
- Grok이 VulcanBench 코딩 벤치마크에서 선두 주자임을 입증했습니다.
- 다섯 가지 언어의 23개 작업 중 21개를 해결하며 높은 성능을 보여주었습니다.
- 경쟁 모델인 Claude Fable 5와 GPT-5.6 Sol보다 우수한 점수를 기록했습니다.
Grok은 91.3%의 점수를 기록하며, 다섯 가지 언어에 걸친 23개의 실제 소프트웨어 작업 중 21개를 해결하여 Claude Fable 5와 GPT-5.6 Sol을 능가했을 뿐만 아니라 비용 효율성 영역에서도 우위를 차지했습니다.
Grok은 계속해서 승리합니다. 🏆 https://t.co/tboYBEORnY
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: Claude/Anthropic의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기