Grok 4.7 xHigh, Artificial Analysis의 AA-Omniscience 벤치마크에서 현저히 낮은 환각률 기록
요약
Grok 4.7 xHigh 모델이 Artificial Analysis의 AA-Omniscience 벤치마크에서 매우 낮은 환각률을 기록하며 성능 우위를 입증했습니다. 이 테스트 결과에 따르면, Grok은 GPT-6 Astra와 Claude Fable 5.1보다 현저히 낮은 환각률을 보여주었습니다.
핵심 포인트
- Grok 4.7 xHigh가 AA-Omniscience 벤치마크에서 우수한 성능을 보임.
- 환각률(Hallucination Rate)이 낮을수록 모델의 신뢰도가 높음을 의미함.
- Grok은 GPT-6 Astra와 Claude Fable 5.1 대비 낮은 환각률을 기록함.
Grok 4.7 xHigh가 Artificial Analysis의 AA-Omniscience 벤치마크에서 놀라울 정도로 낮은 환각률을 달성했습니다.
• Grok 4.7 xHigh — 29% 🏆
• GPT-6 Astra — 51%
• Claude Fable 5.1 — 73%
낮을수록 좋습니다 (Lower is better)
Grok은 환각률 면에서 Astra와 Fable 5.1 모두를 크게 능가합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: Benchmark의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기