
Cursor에서 사용할 수 있는 AI 모델 비교 2026/08
요약
본 기사는 Cursor에서 사용할 수 있는 최신 AI 모델들을 비교 분석합니다. Claude Opus 5, GPT-5.6 패밀리, Gemini 3.5 Flash 등 주요 모델들의 컨텍스트 길이, 벤치마크 성능, API 단가 등을 상세히 다루고 있습니다. 또한, Cursor의 SpaceX 인수 및 xAI Grok 4.5 투입 등 업계 동향도 함께 언급합니다.
핵심 포인트
- GPT-5.6 Sol은 복잡한 에이전트 워크플로우와 코딩에 강점을 보입니다.
- Claude Fable 5는 사이버 보안/자율 생물학 분야에서 특유의 강점을 유지합니다.
- Gemini 3.5 Flash는 낮은 비용으로 멀티모달 및 에이전트 처리에 적합합니다.
- Cursor가 SpaceX에 인수되는 등 업계 세력도 큰 변화를 겪고 있습니다.
안녕하세요, 야시마입니다.
지난달 기사(Cursor에서 사용할 수 있는 AI 모델 비교 2026/07)에서 업데이트되었습니다.
이번 달은 모델 이야기뿐만 아니라 Cursor가 SpaceX에 인수된다는 회사 자체의 큰 뉴스가 있었습니다. 그와 관련하여 xAI가 「SpaceXAI」로 개명하고, Cursor와 공동 학습한 Grok 4.5를 투입하는 등 업계의 세력도가 움직인 한 달이었습니다.
모델 측면에서는 Claude Opus 5 (Opus 4.8의 후속)와 GPT-5.6 패밀리 (Sol/Terra/Luna)가 새로 등장했습니다.
지난번과 마찬가지로, Cursor에서 API 키를 설정하지 않고 사용할 수 있는 모델(그중 사용할 법한 것들)을 AI에게 비교해 달라고 요청했습니다.
비교하는 AI로는 Claude Sonnet 5를 사용했습니다.
그럴싸하게 올려두었지만, 지난번과 마찬가지로 어디까지나 개인적인 참고용입니다.
(그렇다 하더라도 최근에는 과금 문제로 거의 대부분 Auto로 사용하고 있습니다;;)
| 모델 | 컨텍스트 (Context) | 벤치마크 (Benchmark) | 특기 영역 | API 단가 (입력/출력 /1M 토큰) | 특징·비고 |
|---|---|---|---|---|---|
| Claude Fable 5 | 1M 토큰 | CursorBench 66.5% (default) | 초장기 에이전트·사이버/바이오 영역 최고 성능 | $10 / $50 | 6/9 출시. Opus 5 등장으로 상대적인 우위성은 축소되었으나, 사이버 보안·자율형 생물학 분야는 Mythos급 특유의 강점을 유지. 30일 데이터 보존이 필수이며, Zero Data Retention 미지원 |
| ... | |||||
| 모델 | 컨텍스트 (Context) | 벤치마크 (Benchmark) | 특기 영역 | API 단가 (입력/출력 /1M 토큰) | 특징·비고 |
| --- | --- | --- | --- | --- | --- |
| GPT-5.6 Sol ★ | 1.05M 토큰 | Terminal-Bench 2.1 88.8% (Ultra 시 91.9%) / CursorBench Max 67.2% | 최난관 코딩·복잡한 에이전트 워크플로우 (Agent Workflow) | $5 / $30 | 7/9 GA. GPT-5.5 후속 신규 플래그십. 272K 토큰 초과 장문 입력 시 단가가 약 2배 상승하는 점에 주의 |
| ... | |||||
| 모델 | 컨텍스트 (Context) | 벤치마크 (Benchmark) | 특기 영역 | API 단가 (입력/출력 /1M 토큰) | 특징·비고 |
| --- | --- | --- | --- | --- | --- |
| Gemini 3.5 Flash ★ | 1M 토큰 | Terminal-Bench 76.2% | 에이전트·멀티스텝 도구 처리·멀티모달 (Multimodal) | $1.50 / $9 | 변동 없음 |
| Gemini 3.1 Pro | 1M 토큰 | 80.6% (Verified) | 전체 리포지토리 분석·장문 맥락·과학적 추론 | $2 / $12 | 변동 없음. 상위 모델인 3.5 Pro는 아직 출시되지 않음 (상세 내용은 다음 장) |
| 모델 | 프로바이더 (Provider) | 컨텍스트 (Context) | 벤치마크 (Benchmark) | 특기 영역 | API 단가 (입력/출력 /1M 토큰) | 특징·비고 |
|---|---|---|---|---|---|---|
| Composer 2.5 ★ | Cursor | — | SWE-Bench Multilingual 79.8% | 에이전트 실행·일상 코딩·고볼륨 처리 | $0.50 / $2.50 (스탠다드) / $3.00 / $15.00 (고속) | 변동 없음. 후속 모델인 Composer 3 (1.5조 파라미터 풀 사전 학습)는 SpaceX의 Colossus 클러스터에서 훈련 중이나 제공 시기는 미정 |
| Grok 4.5 | xAI | 500K 토큰 | 인터랙티브·에이전트 코딩 | Terminal-Bench 2.1 83.3% / SWE-bench Pro 64.7% | $2 / $6 | 7/8 출시. Grok Build 0.1의 후속으로, Cursor와 공동 학습한 첫 번째 모델. CursorBench에서 유리한 결과가 나오고 있으나, 학습 데이터에 구(舊) Cursor 코드베이스 스냅샷이 혼입되었다는 점이 지적되어 Cursor 공식 측에서도 이 점은 참고치로 취급하고 있음 |
★ = 각 프로바이더의 권장 주력 모델
API 단가는 토큰 기준 (Cursor 경유 시 다를 수 있음)
CursorBench・SWE-bench・Terminal-Bench는 각각 별개의 벤치마크이므로 단순 비교에 주의하십시오.
출처: Cursor 공식 · 각종 벤치마크 (2026년 8월 5일 기준)
지난 회차(2026년 7월 버전)와의 차이점을 정리해 둡니다. 이번 달은 기업 차원의 움직임을 포함하여 정보량이 많습니다.
Cursor가 SpaceX에 인수: 6/16 SEC 8-K를 통해 공개. 약 $60B 규모의 전액 주식 거래로, 2026년 Q3에 완료될 예정입니다. xAI 또한 'SpaceXAI'로 명칭을 변경했으며, 이러한 통합 전략의 첫 번째 가시적인 성과가 후술할 Grok 4.5입니다. -
Claude Opus 5 등장: 7/24 출시. Opus 4.8의 후속 모델로 가격은 기존과 동일($5/$25)하지만, Frontier-Bench에서 4.8보다 2배 이상의 점수를 기록했습니다. CursorBench에서는 Fable 5와 거의 대등한 수준(66.7% vs 66.5%)까지 근접했으며, 특히 Zero Data Retention (ZDR) 대응이 가능하다는 점이 실무적으로 매우 큽니다. -
Claude Opus 4.8 삭제: Opus 5가 후속 모델로 등장함에 따라 표에서 제외되었습니다. -
GPT-5.6 패밀리 (Sol/Terra/Luna) 등장: 7/9에 GA (General Availability) 되었으며, Cursor에도 당일 추가되었습니다. 기존의 GPT-5.5 · GPT-5.4 · GPT-5.3 Codex는 이 3가지 계층으로 정리 및 대체되었습니다. 7/30에는 Terra와 Luna의 가격이 인하되었습니다. -
Grok Build 0.1 → Grok 4.5: 7/8 출시. xAI 최초의 Cursor 공동 학습 모델로, $2/$6라는 파격적인 가격임에도 불구하고 Opus급 성능을 표방합니다.
Gemini 3.5 Pro: 5/19 Google I/O에서 발표된 이후, 6월과 7월에 걸쳐 여러 차례 출시가 연기되었으며, 8/5 시점에도 아직 일반 제공되지 않고 있습니다. 2M 토큰의 컨텍스트 윈도우 (Context Window)와 Deep Think 추론 모드가 핵심이라고 알려져 있으나, 공식 벤치마크나 컨텍스트 사양조차 미확정된 상태입니다. 예측 시장 (Prediction Market)에서는 8월 초 도달 가능성에 높은 확률이 걸려 있었으나, 이 또한 연기될 가능성이 있습니다. -
Composer 3: Cursor의 개발자 이벤트인 'Compile' (6/16)에서, SpaceX의 Colossus 클러스터 상에서 1.5조 파라미터 규모로 풀 사전 학습 (Full Pre-training) 중이라고 발표되었습니다. 기존의 Kimi K2.5 기반 Composer 2 계열과는 달리, Cursor가 완전히 자체 개발한 모델이 될 전망입니다. 제공 시기는 빨라도 2026년 후반으로, 아직 먼 이야기입니다.
초장기 · 초복잡 에이전트 작업, 특히 사이버 보안 관련 → Claude Fable 5 (Mythos급 특유의 강점이 남는 영역) -
어려운 설계 · 자율형 멀티 스텝 (Multi-step)의 최우선 후보 → Claude Opus 5 (Fable 5에 육박하는 성능을 Opus 가격 및 ZDR 대응으로 제공) -
최난도 코딩 · 복잡한 에이전트 → GPT-5.6 Sol (Terminal-Bench · CursorBench 모두 최상위권) -
일상적인 코딩의 기본값 → Composer 2.5, GPT-5.6 Terra, Claude Sonnet 5 등의 가성비 모델 -
비용 우선 · 대량 작업 → GPT-5.6 Luna, Gemini 3.5 Flash, Grok 4.5
이번 달도 솔직한 개인적인 의견을 바탕으로 작성합니다. 여전히 결제 편의성 때문에 Auto를 주력으로 사용하고 있지만, 선택한다면 다음과 같이 정리할 수 있습니다.
평소의 코딩 어시스트: (이상적으로는) Composer 2.5, (현실적으로는) Auto - 변함없음. Opus 5가 ZDR을 지원하면서 가격을 유지하는 점은 매력적이지만, 일상적인 사용에는 오버스펙이라는 느낌이 듭니다.
변경 사항이 많을 때의 코딩 어시스트: Claude Opus 5 - Sonnet 5나 GPT-5.6 Sol도 궁금하지만, 우선은 익숙한 Opus 계열의 후속 모델부터 시도해보고 싶습니다.
Fable 5에 대하여 - 지난달부터 진척이 없습니다. 개인 앱 구상은 여전히 계획 단계에 머물러 있습니다. Pro 플랜과 결제 한도가 분리되어 버려서, 이대로 사라질 것 같은 예감이 듭니다.
간단한 수정 · 루틴 작업: Auto - 변함없음. 가장 자주 쓰이는 위치는 흔들림이 없습니다.
소스를 어느 정도 모아서 질문하고 싶을 때 - Claude Sonnet 5를 신뢰하고 있는 점은 변함없습니다.
이번 달은 모델에 관한 이야기 이전에 "Cursor라는 회사 자체가 SpaceX에 인수된다"라는 뉴스가 있어서, 왠지 들뜬 한 달이었습니다. Grok 4.5가 Cursor와 공동 학습 (Co-learning)을 한다는 조합도, 이 인수를 고려하면 납득이 갑니다.
Opus 5가 Fable 5에 거의 필적하는 성능으로 등장한 것도 은근히 큰 뉴스이며, 다음 달에는 벌써 Fable 5 자체가 표면에서 사라져 버릴지도 모른다는 생각을 하며 이 글을 쓰고 있습니다.
내용에 대한 불만은 받지 않지만, 조언이나 표에 추가하면 좋을 것 같은 항목 등은 환영하니 편하게 말씀해 주세요.
그럼 이만.
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기