GPT-5.6을 통한 가성비(price-performance)의 한계 돌파
요약
OpenAI가 GPT-5.6 모델의 가격을 대폭 인하하며 가성비 경쟁력을 강화했습니다. 특히 GPT-5.6 Sol을 활용한 추론 및 커널 최적화를 통해 운영 비용을 절감하고, Luna 모델의 가격을 파격적으로 낮춰 시장 지형을 변화시키고 있습니다.
핵심 포인트
- GPT-5.6 Terra 20%, Luna 80% 가격 인하 발표
- GPT-5.6 Sol을 통한 추론 및 프로덕션 커널 최적화
- Luna 모델이 Gemini 3.1 Flash-Lite보다 저렴한 가격 경쟁력 확보
- 자율적인 코드 재작성을 통한 엔드 투 엔드 서빙 비용 20% 절감
2026년 7월 30일 - Link Blog
GPT-5.6을 통한 가성비(price-performance)의 한계 돌파 (via) 오늘 OpenAI로부터 엄청난 가격 인하 소식이 전해졌습니다: GPT-5.6 Terra는 20% 인하되었고, GPT-5.6 Luna는 무려 80%나 폭락했습니다.
OpenAI는 이를 가능하게 한 공로를 5.6 Sol에게 돌리고 있습니다: 'How GPT-5.6 fuses frontier intelligence with frontier efficiency(GPT-5.6이 최첨단 지능과 최첨단 효율성을 결합하는 방법)'에서 그들은 5.6 Sol을 사용하여 부하 분산(load balancing)을 최적화하고, 더 인상적이게는 추론(inference) 자체를 최적화했다고 설명합니다:
우리는 또한 모델의 순전파(forward pass), 즉 입력을 다음 토큰 예측으로 변환하는 연산을 최적화하기 위해 GPT-5.6 Sol을 사용했습니다. 개별 연산이 빠르더라도 과도한 메모리 이동, 동기화 및 비효율적인 데이터 레이아웃은 GPU를 유휴 상태로 만들 수 있습니다. 이를 방지하기 위해 GPT-5.6 Sol은 미리 계산하거나, 피하거나, 병렬화할 수 있는 작업을 찾아냈습니다. Codex를 통해 GPT-5.6 Sol은 모델을 구성하는 수학적 연산을 실행하는 핵심 코드인 프로덕션 커널(production kernels)을 자율적으로 재작성하고 최적화했습니다. 이것이 가능했던 이유 중 하나는 우리가 GPT-5.6을 OpenAI가 관리하는 두 가지 오픈 소스 GPU 프로그래밍 언어인 Triton과 Gluon에서 커널을 작성하고 개선하는 데 효과적이도록 훈련시켰기 때문입니다. 이러한 노력은 GPT-5.6 Sol의 광범위한 커널 발전과 결합되어 엔드 투 엔드(end-to-end) 서빙 비용을 20% 절감했습니다.
Luna의 가격 인하는 저가형 모델 시장의 지형을 완전히 바꿔 놓았습니다. 입력 토큰 100만 개당 $0.20, 출력 토큰 100만 개당 $1.20인 Luna는 이제 Google의 Gemini 3.1 Flash-Lite($0.025/$1.50)보다 저렴합니다.
Anthropic의 현재 가장 저렴한 모델은 Claude Haiku 4.5이며 가격은 $1/$5입니다. Luna의 입력 비용은 이전에는 동일했으나 이제는 그 5분의 1 수준입니다.
제 agent.datasette.io 데모 사이트는 Gemini 3.1 Flash-Lite에서 구동되고 있었습니다. 저는 이를 Luna로 전환했습니다.
최근 기사
- OpenAI의 Hugging Face에 대한 우발적 사이버 공격은 실제로 일어난 SF다 - 2026년 7월 22일
- Claude Code 팀의 Cat 및 Thariq와의 Fireside Chat - 2026년 7월 21일
- Kimi K3, 그리고 pelican 벤치마크에서 우리가 여전히 배울 수 있는 것 - 2026년 7월 16일
AI 자동 생성 콘텐츠
본 콘텐츠는 RSS: Simon Willison's Weblog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기