
Meta가 Muse Spark 1.2를 출시했습니다. 이는 4개월 만에 발표된 세 번째 모델로, Artificial Analysis
요약
Meta가 에이전트적 지식 작업 능력이 향상된 Muse Spark 1.2를 출시했습니다. 이 모델은 Artificial Analysis 지능 지수에서 높은 점수를 기록하며 주요 프런티어 모델들과 경쟁하며, 뛰어난 비용 효율성을 제공합니다.
핵심 포인트
- 에이전트적 지식 작업 능력 및 벤치마크 점수 대폭 향상
- GPT-5.5, Grok 4.5와 대등한 수준의 지능 달성
- 지능 수준 대비 매우 높은 비용 효율성 보유
- 환각률 감소 및 기권율 증가를 통한 신뢰도 개선 시도
- 1M 토큰의 컨텍스트 윈도우 유지
Meta가 Muse Spark 1.2를 출시했습니다. 이는 4개월 만에 발표된 세 번째 모델로, Artificial Analysis Intelligence Index에서 54점을 기록하며, 이전 버전보다 에이전트적 지식 작업 (agentic knowledge work) 능력을 크게 향상시켰으며, Meta를 미국 연구소 중 SpaceXAI와 공동 3위로 올려놓았습니다.
Muse Spark 1.2 (xhigh)는 54점을 기록하며, Muse Spark 1.1 (51점)보다 3점, Muse Spark 1.0 (43점, 4월)보다 11점 상승했습니다. 이는 GPT-5.5 (xhigh, 55점) 및 Grok 4.5 (high, 54점)와 사실상 동등한 수준이며, 현재의 프런티어 모델(frontier models)인 Claude Opus 5 (max, 61점), Claude Fable 5 (max w/ fallback, 60점), GPT-5.6 Sol (max, 59점), Kimi K3 (max, 57점)의 바로 뒤를 잇습니다.
출시를 축하하며 @AIatMeta, @finkd, @alexandr_wang에게 축하를 전합니다!
핵심 요약 (Key Takeaways):
➤ Muse Spark 1.2는 에이전트적 지식 작업 (agentic knowledge work) 분야에서 프런티어(frontier)에 더 가까워졌습니다. Muse Spark 1.1 출시 당시, 우리는 에이전트적 지식 작업이 가장 명확한 격차라고 언급한 바 있습니다. Muse Spark 1.2의 성장은 이 격차를 줄이는 데 기여합니다. GDPval-AA v2 Elo 점수는 260점 상승하여 1631점을 기록했으며, 이는 우리가 벤치마킹한 모든 모델 중 5위에 해당하며 Claude Opus 4.8 (max, 1588점)보다 앞섭니다. Terminal-Bench 2.1은 2점 상승(78%에서 80%로), Tau3-Bench Banking은 2점 상승(25%에서 27%로)했습니다.
➤ 해당 지능 수준에서 가장 비용 효율적인 모델 중 하나입니다. Muse Spark 1.2는 Meta의 변동 없는 100만 토큰당 $1.25/$4.25 가격 책정에 따라 Intelligence Index 작업당 $0.40의 비용이 발생합니다. 해당 지능 클러스터 내에서 Grok 4.5 (high, $0.37)와 GPT-5.6 Sol (medium, $0.39)만이 이보다 저렴하며, GPT-5.6 Terra (max, $0.51), Kimi K3 (max, $0.86), GPT-5.5 (xhigh, $1.18)는 모두 작업당 비용이 더 높습니다. Muse Spark 1.1 ($0.29 per task) 대비 비용 상승은 Intelligence Index 작업당 토큰 사용량 증가에 기인합니다.
➤ AA-Omniscience 기권율 (abstention rate)이 증가했습니다. 환각률 (hallucination rate)이 10포인트 하락(38%에서 28%로)하고 시도율 (attempt rate)이 82%에서 67%로 떨어짐에 따라 점수는 18에서 22로 상승했습니다. 이러한 높은 기권율 (확신이 없을 때 질문에 답하지 않는 것)은 현재 낮은 환각률과 더 낮은 정확도 (41%에서 38%로)를 동시에 유발하고 있습니다.
➤ 과학적 추론 (Scientific Reasoning) 결과는 대체로 변동이 없습니다. CritPt는 눈에 띄게 3포인트 상승(15%에서 18%)한 반면, SciCode는 2포인트 하락(58%에서 56%), Humanity's Last Exam은 1포인트 하락(45%에서 44%)했습니다.
기타 모델 세부 사항:
➤ 컨텍스트 윈도우 (Context window): 1M 토큰, Muse Spark 1.1과 동일
➤ 가격 (Pricing): Muse Spark 1.1과 동일: 입력/출력 1M 토큰당 $1.25/$4.25, 캐시 히트 (cache hits) 시 1M 토큰당 $0.15로 할인
➤ 가용성 (Availability): 출시 시 Meta의 퍼스트 파티 (first-party) API 제공
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: Claude/Anthropic의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기