
새로운 GPT-5.6 제품군: Luna, Terra, Sol
요약
OpenAI가 새로운 GPT-5.6 제품군인 Luna, Terra, Sol을 공개했습니다. 세 모델은 각기 다른 크기와 가격대를 가지며, 특히 장기 실행 에이전트 성능에서 Claude Fable 5를 능가하는 벤치마크 결과를 보여줍니다.
핵심 포인트
- Luna, Terra, Sol 세 가지 규모의 모델 라인업 출시
- Agents’ Last Exam 벤치마크에서 Claude Fable 5를 상회하는 성능 기록
- 프로그래밍 방식의 도구 호출(Programmatic Tool Calling) 등 새로운 API 기능 도입
- SWE-bench Pro 결과에 대한 OpenAI의 데이터 결함 지적 및 주의 권고
새로운 GPT-5.6 제품군: Luna, Terra, Sol
2026년 7월 9일
OpenAI의 최신 플래그십 모델이 오늘 아침 일반 공개(general availability)되었으며, Luna, Terra, Sol의 세 가지 크기(가장 작은 것부터 가장 큰 순서)로 제공됩니다.
새로운 모델의 가격은 100만(1M) 입력/출력 토큰당 Luna $1/$6, Terra $2.50/$15, Sol $5/$30로 책정되었습니다. 비교를 위해 살펴보면, Claude Opus 시리즈는 $5/$25이고 Claude Fable 5는 $10/$50이지만, 동일한 작업에 대해 모델 간 추론 토큰(reasoning tokens)의 수가 크게 다를 수 있는 현 시점에서는 토큰당 가격만으로는 많은 것을 알 수 없습니다.
세 모델 모두 2026년 2월 16일 지식 컷오프(knowledge cutoff), 100만 토큰의 컨텍스트 윈도우(context window), 그리고 최대 128,000개의 출력 토큰을 지원합니다.
OpenAI의 가장 큰 벤치마크(benchmark) 주장은 장기 실행 에이전트 성능(long-running agentic performance)에 관한 것이며, 한 벤치마크에서는 세 모델 모두 Claude Fable 5를 능가하는 것으로 나타났습니다:
우리는 모든 토큰에서 더 유용한 작업을 얻을 수 있도록 GPT-5.6을 학습시켰습니다. 55개 분야에 걸친 장기 실행 전문 워크플로우를 평가하는 'Agents’ Last Exam'에서, GPT-5.6 Sol은 53.6점을 기록하며 새로운 최고치를 세웠고, 이는 Claude Fable 5(적응형 추론, adaptive reasoning)를 13.1포인트 차이로 앞선 수치입니다. 중간 수준의 추론(medium reasoning)에서도 GPT-5.6은 추정 비용의 약 4분의 1 수준으로 Fable 5를 11.4포인트 차이로 이깁니다. 이러한 효율성은 지능을 더 풍부하고 저렴하게 만드는 데 필수적인 더 작은 모델들로도 확장됩니다. GPT-5.6 Terra와 GPT-5.6 Luna는 비용의 약 16분의 1 수준에서 Fable 5를 능가합니다.
흥미롭게도, Fable 5가 GPT-5.6 제품군을 압도했다고 스스로 보고한 벤치마크 중 하나는 SWE-Bench Pro였는데, 여기서 Fable 5는 80%를 기록한 반면 GPT-5.6 Sol은 64.6%를 기록했습니다. 이는 OpenAI가 왜 어제 이 기사를 발표하면서 해당 벤치마크를 감사(auditing)하는 동안 발견한 문제점을 구체적으로 언급하며 SWE-Bench Pro를 지목했는지 설명하는 데 도움이 될 수 있습니다:
이러한 결과에 비추어 볼 때, 우리는 SWE-bench Pro 작업의 약 30%가 결함이 있는 것으로 추정하며, 모델 개발자들이 결과를 주의 깊게 검토할 것을 권고합니다.
저는 GPT-5.6 Sol에 대한 조기 액세스 권한을 가졌습니다. 이 모델은 확실히 매우 유능하지만, 지금까지 제가 Anthropic의 모델로 수행해 온 복잡한 코딩 작업 측면에서는 Fable보다 더 낫다는 인상을 받지는 못했습니다.
평소와 마찬가지로, GPT-5.6 사용을 위한 모델 가이드에 가장 흥미로운 세부 사항들이 포함되어 있습니다. 제가 탐색해야 할(그리고 아마도 LLM에 지원 기능을 추가해야 할) 다음과 같은 여러 새로운 API 기능들이 있습니다:
- 프로그래밍 방식의 도구 호출 (Programmatic Tool Calling)은 모델이 "도구 호출을 오케스트레이션하는 JavaScript를 구성하고 실행"할 수 있도록 허용합니다. 이는 MCP와 CLI 유틸리티를 유용한 방식으로 구성할 수 있는 전체 터미널 세션 사이의 간극을 메우는 데 도움이 될 수 있다는 생각이 듭니다. 또한 Anthropic이 웹 검색 도구에 추가한 동적 필터링 (dynamic filtering) 메커니즘을 연상시키는데, 이는 단일 모델 턴 (model turn)의 일부로 웹 검색 결과에 대해 코드 실행을 허용합니다.
- 멀티 에이전트 (Multi-agent)는 모델이 "병렬적이고 집중적인 작업을 위해 서브 에이전트 (subagents)를 생성"할 수 있게 하며, 이 서브 에이전트 패턴은 이제 핵심 API에 내장되었습니다.
- 프롬프트 캐시 중단점 (Prompt cache breakpoints)은 Claude 모델의 프롬프트 캐싱 (prompt caching) 기능을 OpenAI에 가져왔으며, API가 자동으로 감지하도록 맡기는 대신 캐시 중단점이 어디인지 명시적으로 지정할 수 있게 해줍니다. 개인적으로는 자동 감지(OpenAI에서도 여전히 지원됨)를 훨씬 선호하지만, 직접 설정한다면 최적화 비용 절감 효과를 얻을 수 있을 것으로 추정됩니다.
- 이제 이미지 요청 시
detail: original을 설정하여 프로세싱 전에 이미지를 전혀 리사이징하지 않도록 할 수 있습니다.
여기 세 가지 서로 다른 모델에 대해 추론 노력 (reasoning efforts)을 none, low, medium, high, xhigh, max로 설정했을 때의 18가지 서로 다른 펠리컨이 담긴 전체 페이지가 있습니다. 또한 토큰 및 계산된 비용도 나열되어 있습니다. 가장 저렴한 것은 effort none 설정의 gpt-5.6-luna로 0.71센트였고, 가장 비싼 것은 max 추론 레벨 설정의 gpt-5.6-sol로 48.55센트였습니다.

펠리컨에 관한 추가 소식으로, 오늘 아침 라이브 스트림의 17:50 지점으로 넘어가면 세발자전거, 자전거, 조랑말, 그리고 또 다른 펠리컨을 타는 3D 펠리컨에 대한 OpenAI 자체 데모를 볼 수 있습니다!

AI 자동 생성 콘텐츠
본 콘텐츠는 RSS: Simon Willison's Weblog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기