
GPT-6 Astra가 GoBench에서 최고 점수를 기록하다
요약
새로운 벤치마크인 GoBench를 통해 LLM의 일반 추론 능력을 측정했습니다. GPT-6 Astra max는 Sol max와 비교하여 2568 Elo를 달성하며, Opus 5 high보다 높은 성능을 보였습니다. 특히 인터넷 연결 없이 코딩 기능을 활성화한 Codex with Astra는 3563 Elo로 뛰어난 점수를 기록했습니다.
핵심 포인트
- GoBench는 LLM의 일반 추론 능력을 측정하는 새로운 벤치마크입니다.
- GPT-6 Astra max가 Sol max 대비 높은 성능(2568 Elo)을 달성했습니다.
- Codex with Astra는 코딩 기능 활성화 시 3563 Elo로 최고 점수를 기록했습니다.
저는 LLM들이 바둑 게임을 플레이하게 하여 일반 추론 능력을 측정하는 새로운 벤치마크를 만들었습니다. GPT-6 Astra max는 Sol max와 비교하여 2568 Elo를 달성했으며, Opus 5 high의 2076 Elo보다 높습니다. 인터넷 연결 없이 코딩 기능을 활성화한 Codex with Astra는 3563 Elo를 달성하여, 2656 Elo를 기록한 Codex with Sol보다 훨씬 뛰어납니다. 리더보드: https://rolandgao.com/blog/gobench/ /u/Roland31415가 r/OpenAI에 제출했습니다. [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기