Meta Muse Spark 1.1: Meta의 첫 유료 에이전트 모델 — 가격, 벤치마크 및 개발자 영향
요약
Meta Superintelligence Labs가 유료 API 기반의 첫 에이전트 모델인 Muse Spark 1.1을 출시했습니다. 경쟁 모델 대비 매우 저렴한 가격을 강점으로 내세우며, 도구 사용 능력에서 뛰어난 성능을 보이지만 순수 코딩 정확도는 다소 낮습니다.
핵심 포인트
- 입력 100만 토큰당 $1.25로 경쟁사 대비 매우 저렴한 가격
- JobBench 및 MCP Atlas에서 최고 점수를 기록한 강력한 도구 사용 능력
- SWE-Bench Pro 등 순수 코딩 벤치마크에서는 OpenAI 및 Anthropic에 뒤처짐
- 능동적 압축 기능을 통한 1M-토큰 컨텍스트 윈도우 관리
요약 (TL;DR) — 2026년 7월 9일, Meta Superintelligence Labs는 유료 API 기반의 첫 번째 모델인 Muse Spark 1.1을 출시했습니다. 가격은 입력 100만 토큰당 $1.25, 출력 100만 토큰당 $4.25이며 $20의 무료 크레딧이 제공됩니다. 이는 Anthropic의 Opus 4.8 ($5/$25) 및 OpenAI의 GPT-5.5 ($5/$30)와 비교했을 때 출력 비용 측면에서 67배 더 저렴합니다. 이 모델은 전문적이고 확장된 도구 사용 측면에서 JobBench (54.7)와 MCP Atlas (88.1)에서 최고 점수를 기록했으나, 순수 코딩 능력에서는 뒤처집니다: SWE-Bench Pro (61.5 vs Opus의 69.2) 및 DeepSWE (53.3 vs GPT-5.5의 67.0). 주의할 점은 **대기 명단이 있는 미국 전용 퍼블릭 프리뷰 (public preview)**로 제공되며, OpenRouter 지원이 없고 오픈 소스 버전의 출시일도 정해지지 않았다는 것입니다. Meta는 깃발을 꽂고 있지만, 제한된 접근성과 엇갈리는 코딩 점수로 인해 이번 출시는 "지금 당장 전환하라"는 순간이 아닌 "주의 깊게 지켜보며 가능한 한 프로토타입을 만들어보라"는 단계입니다.
서론
AI 책임자 Alexandr Wang 체제 아래 Muse Spark를 공개한 지 3개월 만에, Meta는 코딩 에이전트 전쟁에서 첫 발을 뗐습니다. 2026년 7월 9일에 출시된 Muse Spark 1.1은 전략적 전환점입니다. Meta가 처음으로 개발자들에게 자체 프런티어 모델 (frontier model)에 대한 API 접근 권한을 유료로 제공하기 때문입니다.
2026년 4월의 오리지널 Muse Spark는 엄선된 파트너들을 대상으로 한 프리뷰 버전이었으며, 코딩 및 에이전트 작업 (agentic work) 능력에서 공개적으로 약점을 보였습니다. 버전 1.1은 Wang이 능력의 "단계적 변화 (step-change)"라고 부르는 개선 사항과 기존 업체들을 압박하기 위해 설계된 가격표를 통해 바로 그 격차를 공략합니다 (CNBC).
솔직한 평가를 하자면: Muse Spark 1.1은 에이전트 도구 사용 (agentic tool-use) 경쟁에서는 승리했지만, 순수 코딩 정확도에서는 Opus 4.8과 GPT-5.5에 양보했습니다. 또한 퍼블릭 프리뷰 (public preview)는 미국 전용이며 대기 명단이 필요합니다. 유럽 및 기타 지역의 개발자들은 아직 이를 사용할 수 없습니다.
출시 내용
Muse Spark 1.1은 Alexandr Wang 체제하에 구성된 부서인 **Meta Superintelligence Labs (MSL)**에서 출시되었습니다. 내부 코드명은 Avocado이며, Meta가 유료 결제 장벽 (paywall) 뒤에 배치한 최초의 모델입니다 (CNBC).
| 사양 (Spec) | 세부 사항 (Detail) |
|---|---|
| 모델 유형 (Model type) | 멀티모달 추론 (Multimodal reasoning) (사고 모드 (Thinking mode)) |
| ... |
1M-토큰 컨텍스트 윈도우 (context window)는 능동적 압축 (active compaction) 기능으로 주목할 만합니다. 모델이 스스로 윈도우를 관리하며, 세션이 길어짐에 따라 무엇을 활성 메모리에 유지하고 무엇을 압축할지 결정합니다. 몇 시간 동안 지속되는 에이전트 실행 (agentic runs)의 경우 이것이 매우 중요합니다. 단순한 컨텍스트 채워넣기 (context-stuffing) 방식은 대부분의 장기 세션 에이전트가 비용과 일관성 측면에서 무너지는 원인이 됩니다 (Lushbinary).
이중 SDK 호환성은 조용한 배포 측면의 승리입니다. 기존 OpenAI 또는 Anthropic 클라이언트를 https://api.meta.ai/v1으로 지정하고, 모델을 muse-spark-1.1로 설정하기만 하면 기존 코드를 그대로 유지할 수 있습니다. 이는 A/B 테스트를 위한 마찰이 거의 없는 (near-zero-friction) 교체 방식입니다 (Digital Applied).
가격 책정: 공격적이지만, 추론 토큰(Reasoning-Token)이라는 함정이 있음
Meta는 기존 업체들을 극적으로 저가 공세로 압도하기 위해 Muse Spark 1.1의 가격을 책정했습니다 (CNBC):
| 입력 (Input, 1M 토큰당) | 출력 (Output, 1M 토큰당) | |
|---|---|---|
| Muse Spark 1.1 | $1.25 | $4.25 |
| ... |
신규 계정에는 $20의 무료 크레딧이 제공되지만, 이는 평가용일 뿐 프로덕션(production)용은 아닙니다. Wang은 이 가격 책정이 "매우 공격적이고 매력적"이며 "엄청난 소비량과 함께 규모를 확장(scale)"하기 위한 것이라고 말했습니다 (Reuters via CNBC).
추론 토큰(reasoning-token)의 함정. Muse Spark 1.1은 답변하기 전에 생각합니다. 사고 토큰(Thinking tokens)은 reasoning_tokens로 나타나며, 출력(output) 비용인 $4.25/M로 청구됩니다. reasoning_effort 파라미터는 minimal에서 xhigh까지 설정할 수 있으며, 작업의 복잡도에 맞춰 노력을 조절하는 것이 청구서 금액을 조절하는 주요 레버(lever)입니다. 과도한 추론 작업량은 헤드라인에 제시된 가격보다 훨씬 더 많은 비용이 발생합니다 (AIReiter).
정가 기준으로 Muse Spark의 출력 비용은 GPT-5.5보다 약 6배 저렴합니다. 하지만 제3자 릴레이(third-party relays) 서비스들은 이미 대기 명단 없이 Muse Spark 자체 가격보다 낮은 약 $0.60(입력) / $3.00(출력) 수준으로 Sonnet급 Claude를 제공하고 있습니다.
벤치마크: 엇갈리는 평가
Meta가 직접 공개한 출시 표는 명확한 이야기를 들려줍니다. Muse Spark 1.1은 에이전트(agent) 및 도구 사용(tool-use) 벤치마크에서는 선두를 달리고 있지만, 순수 코딩(coding) 및 멀티모달(multimodal) 성능에서는 뒤처집니다 (Digital Applied). 모든 수치는 제조사가 보고한 것이며, 경쟁 모델들은 각자의 가장 강력한 모드(Opus 4.8은 max, GPT-5.5는 xhigh, Gemini 3.1 Pro는 high)로 설정되었습니다. 높은 점수는 굵게 표시되었습니다.
| 벤치마크 | 카테고리 | Muse Spark 1.1 | Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|---|
| MCP Atlas | 에이전트 · 확장된 도구 사용 | 88.1 | 82.2 | 75.3 | 78.2 |
| ... | |||||
| 출처: Meta 출시 블로그; (Digital Applied, Lushbinary)에서 취합 |
패턴 분석
네 가지 에이전트 항목인 MCP Atlas, JobBench, Humanity's Last Exam, 그리고 Finance Agent v2(57.2, 표시되지 않음)에서 Muse Spark 1.1이 1위를 차지했습니다. JobBench에서의 우위(54.7 vs Opus의 48.4 vs GPT의 38.3)는 실제 워크플로에서의 전문적인 도구 사용 능력을 측정합니다. 여러 MCP 서버에 걸친 확장된 도구 사용에 대한 MCP Atlas의 88.1점은 실제 API를 대상으로 실제 도구를 실행하는 에이전트를 구축할 때 매우 중요한 역량입니다.
컴퓨터 사용(OSWorld) 측면에서는 80.8점으로 Opus의 83.4점에 밀려 뒤처졌으나, 근소한 차이를 보였습니다. 코딩(SWE-Bench Pro, DeepSWE, Terminal-Bench) 전반에 걸쳐서는 안정적인 3위를 기록했습니다. 이는 도구 오케스트레이션(tool-orchestration) 경쟁에서는 승리하고 원시 정확도(raw accuracy)는 양보한 모델입니다. 에이전트 개발자들에게는 이것이 아마도 올바른 트레이드오프(trade-off)일 것입니다.
1.1 버전에 대한 독립적인 벤치마크(benchmarks)는 아직 부족한 상태입니다. Artificial Analysis는 기존 4월의 Muse Spark를 Intelligence Index 52로 평가했으며, 이는 Gemini 3.1 Pro와 Claude Opus 4.6에 뒤처지는 수치였습니다. 1.1 업데이트는 Meta의 내부 스위트(internal suite) 전반에 걸쳐 대략 43포인트의 상승을 기록하고 있으나, 출시 당시 제3자 검증 데이터인 SWE-Bench Verified 수치는 공개되지 않았습니다 (AIReiter). Meta가 패배한 항목(rows it loses)을 투명하게 보여주고 있다는 점에서 이 패턴은 신뢰할 만합니다. 다만 정확한 수치는 확정된 판결이 아닌 시작 단계의 가설로 취급해야 합니다.
에이전트 역량 (Agentic Capabilities)
아키텍처의 핵심은 **네이티브 멀티 에이전트 오케스트레이션 (native multi-agent orchestration)**입니다. 동일한 모델이 기본 에이전트(primary agent)와 하위 에이전트(subagent) 역할을 모두 수행합니다. 즉, 리드 인스턴스(lead instance)가 작업을 조각으로 나누고, 병렬 하위 에이전트들에게 위임한 다음, 결과를 수집하는 방식입니다. 이러한 오케스트레이터-워커(orchestrator-worker) 패턴은 프레임워크에 의해 덧붙여진 것이 아니라 모델 자체에 내장되어 있습니다 (Lushbinary).
네 가지 지원 빌딩 블록(building blocks):
- 컴퓨터 사용 (Computer use). 일상 언어로 된 목표로부터 실제 Linux 데스크톱을 구동합니다 — 스크린샷 촬영, 추론, 클릭, 반복 과정을 거칩니다. OSWorld 80.8 점수를 기록하며 Opus 4.8의 83.4 점수에 근접한 성능을 보여줍니다 (AIReiter).
- 네이티브 MCP 지원 (Native MCP support). 모델 컨텍스트 프로토콜(Model Context Protocol)을 네이티브로 지원합니다. MCP Atlas 88.1과 결합된 이 기능은 에이전트 모델을 일반 채팅 모델과 구분 짓는 요소입니다.
- 커스텀 스킬 (Custom skills) 및 내장 웹 검색 (built-in web search). 재사용 가능한 역량을 일급 기본 요소(first-class primitives)로 제공합니다. 실시간 인용 답변을 위해 모든 Responses API 호출에
{"type": "web_search"}를 추가할 수 있습니다.
초기 파트너들도 이러한 포지셔닝을 뒷받침합니다. Replit의 Amjad Masad는 이를 "완전한 에이전트 기반(agentic foundation)"이라고 불렀으며, Cline의 Saoud Rizwan은 "실행 가능한 가격대에서 실제 코딩 워크로드를 실행할 수 있을 만큼 강력한 도구 사용 능력(tool use)"을 강조했습니다 (Digital Applied).
액세스: 중요한 관문들 (Access: The Gates That Matter)
Muse Spark 1.1은 퍼블릭 프리뷰(public preview) 단계에서 Meta Model API를 통해 이용할 수 있습니다:
- Meta 개발자 포털에서 가입; 계정당 $20의 무료 크레딧 제공
- 현재 미국 내에서만 가능 — 초기 파트너들은 접근 권한을 보유하고 있으며, 신규 사용자는 대기 명단(waitlist)에 등록해야 함
- OpenRouter에서 제공되지 않음 — Meta는 의도적으로 API 접근을 자사 플랫폼으로 제한하고 있음 (CNBC)
일반 소비자들에게는 Meta AI 앱의 Thinking 모드에서 실시간으로 제공됩니다. Wang은 이 모델이 결국 WhatsApp, Instagram, Facebook 및 스마트 글래스 전반에서 Llama 모델들을 대체할 것으로 예상합니다. 미국 한정 대기 명단은 가장 큰 실질적 장벽입니다. 오늘날 프론티어 에이전틱 모델(frontier agentic models)이 필요한 유럽 및 아시아 팀들은 전 세계적으로 사용 가능한 Claude, GPT 또는 Gemini를 사용해야만 합니다.
시장 분석 (Market Analysis)
Meta의 $1.25/$4.25 가격 책정은 코딩 에이전트(coding-agent) 분야의 하이퍼스케일러(hyperscaler) 중 가장 공격적이며, 표기 가격 기준으로 Opus 4.8 출력 대비 6배, GPT-5.5 대비 7배 더 저렴합니다. 이는 의도적인 가격 압축(price compression) 전략입니다. 경쟁사들이 가격을 맞추거나 자신들의 프리미엄을 정당화하도록 강요하는 것입니다. Anthropic이 $3/$15에 Sonnet 4.6을 출시했을 때 미드 티어(mid-tier) 시장이 형성되었으나, Muse Spark는 Opus급의 에이전틱 성능을 주장하면서도 그보다 더 낮은 가격을 제시합니다.
벤치마크의 분리는 시장이 양분되고 있음을 보여줍니다. 순수 코딩 (Pure coding) (SWE-Bench, DeepSWE) 영역은 Opus 4.8이 선두를 달리고 있으며 원시 정확도(raw accuracy)가 유일한 지표입니다. 에이전틱 코딩 (Agentic coding) (MCP Atlas, JobBench) 영역은 도구 오케스트레이션(tool orchestration)과 다단계 계획(multi-step planning)이 더 중요한 영역입니다. Muse Spark 1.1은 두 번째 시장을 목표로 합니다. Wang은 이를 명확하게 표현했습니다: "전반적인 에이전틱 역량에 기여하기 위해 코딩 능력을 그 일부로서 구축해야 합니다" (CNBC).
Meta는 구조적 이점을 가지고 있습니다. Muse Spark 1.1은 이미 Facebook과 Instagram을 구동하고 있는 인프라 위에서 실행되며, Meta Compute(7월 1일 클라우드 출시)와 결합되어 순수 AI 연구소들이 갖지 못한 비용 측면의 레버리지를 제공합니다. Wang은 오픈 소스 변형 모델이 "개발 중"이며 출시일은 정해지지 않았다고 확인했습니다. 이는 코딩 에이전트 분야에서 잠재적인 Llama 모먼트(Llama-moment)가 될 수 있지만, 아직 제품 단계는 아닙니다. 또한 Meta는 "Avocado보다 한 자릿수 더 많은 컴퓨팅 자원"을 사용하는 더 큰 모델인 Watermelon을 훈련 중이며, 내부 보고서에 따르면 주요 벤치마크에서 GPT-5.5와 대등한 성능을 보일 것으로 시사됩니다.
Muse Spark 1.1 기반으로 구축해야 할까요?
| 유스케이스 (Use case) | 권장 사항 | 이유 |
|---|---|---|
| 에이전트적 / 컴퓨터 사용 (computer-use) 프로토타입 | 대기 명단(waitlist)에 등록하세요 | 멀티 에이전트 레시피와 컴퓨터 사용은 이 모델이 분야를 선도하는 지점입니다; $20 크레딧을 통해 무료로 탐색이 가능합니다 |
| ... |
Muse Spark 1.1은 대부분의 팀에게 "지금 즉시 전환"해야 할 대상은 아닙니다. 그보다는 "면밀히 관찰하고, 접근 권한을 얻으면 프로토타입을 제작하라"는 대상에 가깝습니다. 또한 이는 Meta가 업계에 압박을 가하는 가격 정책과 함께 다시 프런티어 경쟁에 뛰어들었음을 상기시켜 줍니다.
FAQ
Muse Spark 1.1이란 무엇인가요?
2026년 7월 9일에 출시된 Meta Superintelligence Labs의 멀티모달 추론 모델 (multimodal reasoning model)입니다. 1M 토큰의 자체 관리 컨텍스트 윈도우 (context window), 네이티브 기본 에이전트 및 서브 에이전트 오케스트레이션 (primary-agent and subagent orchestration), MCP 지원, 커스텀 스킬, 그리고 컴퓨터 사용 모드 (computer-use mode)를 특징으로 합니다. 유료 개발자 API를 통해 제공되는 최초의 Meta 모델입니다.
API 비용은 얼마인가요?
입력 1M 토큰당 $1.25, 출력 1M 토큰당 $4.25이며, 신규 계정에는 $20의 무료 크레딧이 제공됩니다. 내부 추론 토큰 (internal reasoning tokens)은 출력 요율로 청구됩니다. reasoning_effort (minimal에서 xhigh까지)를 사용하여 비용을 제어할 수 있습니다.
벤치마크에서 Claude 및 GPT와 비교하면 어떤가요?
에이전트적 도구 사용 (JobBench 54.7, MCP Atlas 88.1)에서는 앞서지만, 순수 코딩 (SWE-Bench Pro 61.5 vs Opus의 69.2, DeepSWE 53.3 vs GPT-5.5의 67.0)에서는 뒤처집니다. 이 모델은 코딩 정확도 리더가 아닌, 도구 오케스트레이션 (tool-orchestration) 전문가입니다.
미국 이외의 지역에서도 사용할 수 있나요?
공식 Meta Model API를 통해서는 불가능합니다. 퍼블릭 프리뷰 (public preview)는 대기 명단 (waitlist)이 있는 미국 전용 서비스입니다. 즉각적인 사용을 원하신다면 Claude, GPT 또는 Gemini를 사용하세요.
Muse Spark는 오픈 소스인가요?
아니요 — 독점적 (proprietary)이며 유료입니다. 오픈 소스 변형 모델이 개발 중이지만 출시일은 정해지지 않았습니다.
OpenRouter에서 사용할 수 있나요?
아니요. Meta는 의도적으로 API 접근을 자사의 자산으로 제한하고 있습니다.
어떤 SDK와 호환되나요?
OpenAI SDK (Chat Completions + Responses) 및 Anthropic SDK (Messages format) 모두와 즉시 교체 가능한 (drop-in) 호환성을 제공합니다. Base URL을 https://api.meta.ai/v1로, 모델을 muse-spark-1.1로 설정하세요.
Meta의 모델 라인업의 다음 행보는 무엇인가요?
'Watermelon'이라는 코드명의 더 큰 모델이 훈련 중이며, 이는 Avocado (Muse Spark)보다 10배(an order of magnitude) 더 많은 컴퓨팅 자원을 사용합니다. 내부 보고서에 따르면 GPT-5.5와 대등한 수준으로 추정되나 출시일은 발표되지 않았습니다.
추가 읽기
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기