
프런티어의 개방: 8일 만에 이루어진 4개의 프런티어 출시 - Grok 4.5, GPT-5.6, Muse Spark 1.1, 그리고 어제의
요약
최근 8일 동안 Grok 4.5, GPT-5.6, Muse Spark 1.1, Kimi K3 등 4개의 프런티어급 모델이 연달아 출시되었습니다. 이로 인해 고성능 모델을 보유한 연구소가 6개로 늘어났으며, 모델 간 성능 격차는 줄어들고 지능의 비용은 급격히 하락하고 있습니다.
핵심 포인트
- 8일 만에 4개의 신규 프런티어 모델 출시
- 고성능 모델 보유 연구소가 2개에서 6개로 급증
- Kimi K3가 에이전트 및 지식 작업 벤치마크에서 상위권 진입
- 프런티어급 지능의 작업당 비용이 2~3배 저렴해짐
프런티어(Frontier)가 열렸습니다: 8일 만에 4개의 프런티어 모델이 출시되었습니다 - Grok 4.5, GPT-5.6, Muse Spark 1.1, 그리고 어제 출시된 Kimi K3; 이제 6개의 연구소가 Artificial Analysis Intelligence Index에서 50점 이상의 점수를 기록하는 모델을 보유하게 되었으며, 이는 6월 초 2개 연구소에서 증가한 수치입니다.
@SpaceXAI의 Grok 4.5 (높음, Artificial Analysis Intelligence Index 점수: 54)가 7월 8일에 등장했고, @OpenAI의 GPT-5.6 Sol, Terra, Luna (최대: 59, 55, 51)와 @AIatMeta의 Muse Spark 1.1 (매우 높음, 51)이 하루 뒤에 뒤따랐으며, @Kimi_Moonshot의 Kimi K3는 어제 57점으로 출시되었습니다 - 이는 Claude Opus 4.8 (최대, 56)을 앞선 전체 3위 기록입니다.
현재 인덱스(Index) 상위 3개 모델은 서로 다른 3개의 연구소에서 나왔으며, 점수 차이는 단 3점에 불과합니다. 10개의 최고 점수 모델 중 4개가 7월 8일 이후 출시되었으며, 6월 초 이후로는 10개 중 6개가 출시되었습니다.
변하지 않은 단 한 가지는 1위입니다: Claude Fable 5 (최대, 60)는 6월 9일 이후 정상의 자리를 지키고 있지만, 그 격차는 4점에서 1점으로 좁혀졌으며, 그 이면에 있는 지능의 가격은 폭락했습니다.
놀라운 8일을 보낸 @elonmusk, @sama, @finkd, 그리고 4개 연구소의 모든 팀에게 축하를 전합니다.
핵심 요약 (Key Takeaways):
➤ 프런티어 연구소는 6주 만에 2개에서 6개로 늘어났습니다. 6월까지는 Anthropic과 OpenAI만이 51점 이상의 모델을 선보였습니다. 6월 중순 GLM-5.2 (최대)가 Z AI를 합류시켰고, 지난주에는 SpaceXAI와 Meta가 추가되었으며, 오늘 Kimi K3가 57점으로 진입하며 Moonshot AI를 6번째 연구소로 만들었습니다.
➤ Kimi K3는 에이전트적 (agentic) 능력과 지식 작업 (knowledge work) 점수에서 상위 2개 모델에 이어 3위로 데뷔했습니다. K3는 GDPval-AA v2에서 1668 Elo를 기록하며 Claude Fable 5 (최대, 1760)와 GPT-5.6 Sol (최대, 1748)에 이어 3위를 차지했습니다. 장기 지식 작업 (long-horizon knowledge work) 벤치마크인 AA-Briefcase에서 K3는 1547 Elo로 2위에 진입했습니다 - Claude Fable 5 (최대, 1583)의 뒤를 잇고 GPT-5.6 Sol (최대, 1495)보다 앞서며 - 분석 품질 (Analytical Quality) Elo (1760)는 사실상 Fable 5 (1764)와 동등한 수준입니다. $3/$15의 가격 책정 하에서 Intelligence Index 작업당 $0.94의 비용으로, Claude Opus 4.8 (최대, $1.80)과 유사한 지능을 작업당 비용 면에서 약 절반 가격으로 제공합니다.
➤ 프런티어에 근접한 지능 (Near-frontier intelligence)이 8일 만에 2~3배 더 저렴해졌습니다. GPT-5.6 Sol (최대)는 지능 지수 (Intelligence Index) 작업당 $1.04의 비용으로, $2.75를 소모하는 Claude Fable 5 (최대)보다 단 1포인트 낮은 성능을 제공합니다. Grok 4.5 (높음)는 $0.31의 비용으로 54점을 기록하며, GPT-5.5 (매우 높음, $0.99) 비용의 3분의 1 미만으로 성능을 구현합니다. 51점을 기록한 GPT-5.6 Luna (최대, $0.21)와 Muse Spark 1.1 (매우 높음, $0.26)은 일주일 전 해당 수준에서 가장 저렴했던 GLM-5.2 (최대, $0.32)의 가격을 밑돌았습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: Benchmark의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기