GPT-6 Luna와 GPT-5.6 Luna 비교: 가격은 절반, 분량은 적다
요약
GPT-6 Luna와 GPT-5.6 Luna를 비교 분석한 결과, GPT-6 Luna는 작업당 비용이 절반 수준으로 매우 효율적입니다. 벤치마크 점수는 유사하지만, 목표만 주어진 프롬프트에서는 GPT-6 Luna가 사건 기간 등 세부 정보를 누락하는 경향을 보였습니다.
핵심 포인트
- GPT-6 Luna는 GPT-5.6 Luna 대비 비용 효율성이 높습니다.
- 목표 기반 프롬프트에서 GPT-6 Luna는 세부 정보(사건 기간) 누락이 잦았습니다.
- 필수 요소가 명시된 경우 두 모델 모두 높은 완성도를 보였습니다.
GPT-6 Luna는 공개 벤치마크(Artificial Analysis Intelligence Index에서 38 대 37)에서 GPT-5.6 Luna와 동등한 수준이며, 작업당 비용은 약 절반입니다. 차이점은 작성하는 내용에 있습니다. 프롬프트가 단순히 목표("3분기 검토서 작성")만을 명시했을 때, GPT-6 Luna는 80개의 비즈니스 문서 전반에 걸쳐 0.55배의 단어를 작성했습니다. 요청된 부분을 건너뛰지 않았습니다. 필수 부분이 명시되었을 때는 두 모델 모두 동등하게 완벽했지만, 목표만 주어진 프롬프트에서 GPT-6 Luna가 더 자주 누락한 세부 정보는 사건 기간이었습니다.
요약 (TL;DR)
- Artificial Analysis 점수는
max노력 기준으로 GPT-6 Luna에 38점을, GPT-5.6 Luna에 37점을 부여했으며, 작업당 비용은 $0.07 대 $0.18입니다. - 목표만 주어진 프롬프트의 경우, GPT-6 Luna는 문서당 384단어를 작성한 반면, GPT-5.6 Luna는 703단어를 작성했습니다.
- GPT-6 Luna는 목표만 주어진 20개의 사건 사후 검토서 중 9개에서 사건 기간을 누락했고, GPT-5.6 Luna는 2개에서 누락했습니다.
- 필수 부분이 명시된 경우, GPT-6 Luna는 80개 문서 중 74개에서 완벽했으며, GPT-5.6 Luna는 1,000개당 $0.81 대 $1.61로 각각 69개였습니다.
GPT-6 Luna는 벤치마크에서 GPT-5.6 Luna와 어떻게 비교되나요?
GPT-6 Luna는 일반적인 벤치마크에서 GPT-5.6 Luna와 비교했을 때 작업당 비용이 48%에서 61% 더 낮으며, 두 모델은 루브릭(채점 체크리스트)에 따라 점수를 매긴 문서에서는만 차이를 보입니다. 점수는 추론 노력(reasoning effort), 즉 모델이 답변하기 전에 얼마나 많이 추론하는지를 설정하는 API 설정(none부터 max, 기본값 medium)을 기준으로 인용되었습니다. 이 수치들은 2026-10-02에 발행사 페이지에서 읽은 것입니다.
| GPT-6 Luna | GPT-5.6 Luna | |
|---|---|---|
| 출시일(Released) | 2026-09-22 | 2026-07-09 |
| ... |
GPTval-AA는 GPT-6 Luna에 대한 불만이 시작된 지표입니다. Artificial Analysis가 출시 분석을 통해 GPT-6 Luna를 GDPval-AA에서 GPT-5.6 Luna보다 약 75 Elo 포인트를 낮게, 그리고 두 번째 문서 벤치마크인 AA-Briefcase v1.1에서는 약 45 포인트 낮게 평가했으며, 그 원인을 "제출물 품질 저하 및 루브릭 요소를 누락한 결과물"로 지적했습니다. 리뷰어들은 이를 "포맷 세금(format tax)"이라고 명명했습니다. 현재 리더보드는 최대치에서 25점의 격차를 보여주며, 중간 수준에서는 GPT-6 Luna가 129점 앞서고 있습니다.
다른 공급업체들과 비교했을 때, GPT-6 Luna는 플래시 티어(flash tier) 즉 저가형 고속 모델과 경쟁합니다. 동일한 지표에서 DeepSeek V4.1 Flash는 최대치에서 작업당 $0.27에 39점을 기록했고, Gemini 3.8 Flash는 높은 수준에서 작업당 $1.24에 41점을 기록했습니다. 따라서 GPT-6 Luna는 작업당 비용이 4배에서 18배까지 낮아지는 대신 1점에서 3점 정도를 포기합니다. 두 모델 모두 초당 209개 및 249개의 토큰으로 더 빠르게 생성됩니다.
가격 외에 무엇이 변경되었나요?
GPT-6 Luna는 GPT-5.6 Luna의 제한 사항과 설정을 유지하고 있으며, 변경된 부분은 캐시 가격과 지식 차단일(knowledge cutoff)뿐입니다. 두 모델 모두 1,050,000 토큰의 컨텍스트 창과 128,000 토큰의 출력 한도를 가지고 있으며, 프롬프트가 272K 토큰을 초과하는 경우 전체 요청에 대해 입력은 2배, 출력은 1.5배를 부과합니다. 캐시된 입력 비용은 이전 $0.02에서 $0.01/백만 토큰으로 하락했으며, 지식 차단일은 2월 16일에서 2026년 5월 18일로 변경되었습니다. 노력(Effort)은 Responses API의 reasoning.effort를 통해 설정할 수 있으며 (none, low, medium, high, xhigh, max), 추론 과정은 숨겨져서 출력 토큰으로 청구됩니다.
출시 후 일주일 만에 OpenAI는 상위 등급의 GPT-6.1 Sol을 GPT-6 Sol의 후속작으로 출시했으며, 저희 GPT-6.1 Sol 측정치를 통해 그 답변이 예전 길이로 돌아왔음을 확인했습니다. Luna는 업데이트가 없었기 때문에, 우리는 GPT-6 Luna가 무엇을 더 짧게 작성하는지, 무엇을 빠뜨리는지, 그리고 무엇이 그것을 원래대로 되돌리는지를 측정했습니다.
테스트 방법은 어땠나요?
우리는 코드로 검증할 수 있는 요구사항을 가진 문서 작업을 작성하여 심사 모델(judge model)의 개입 없이 진행했습니다. 각 작업은 모델에게 합성 데이터 블록을 제공하고, 이를 기반으로 문서를 작성하도록 요청합니다:
| 문서 | 데이터 | 독자가 기대하는 내용 |
|---|---|---|
| 분기별 검토 보고서 | 6개에서 12개 지역의 매출액 | 모든 지역이 다루어지고, 가장 큰 하락을 보인 지역이 명시됨 |
| ... |
각 작업은 동일한 데이터에 대해 두 가지 프롬프트 스타일로 구성됩니다. 목표만 제시된(goal-only) 프롬프트는 문서가 무엇인지 설명하고 그 부분에 대해서는 아무것도 언급하지 않습니다(
2026년 10월 2일, 우리는 두 모델 모두에서 80개의 목표 전용(goal-only) 항목을 다섯 가지 노력도(effort settings)로 테스트하고 GPT-6 Luna에서는 하나의 상세 수준(verbosity setting)으로 테스트했으며, 또한 두 모델 모두에서 80개의 명명된 부분(named-part) 항목을 기본 노력도인 1에 맞춰 테스트했습니다. 총 1,040개의 응답 API 호출이 이루어졌습니다. 모든 프롬프트는 고유한 무작위 문자열을 포함했기 때문에 캐시에서 온 응답은 없었으며, 비용은 OpenAI의 목록 가격을 사용했습니다. 두 모델 모두 동일한 항목에 대해 답변했으므로, 우리는 정확한 McNemar 테스트(두 모델이 다른 항목에 대한 쌍별 테스트)와 Holm 보정(여러 비교를 한 번에 테스트할 때 임계값을 강화하는 것)을 사용하여 이를 비교했습니다. 생존하는 격차만이 차이라고 불립니다.
GPT-6 Luna가 GPT-5.6 Luna보다 적게 작성하는가?
GPT-6 Luna는 기본 노력도에서 목표 전용 프롬프트에 대해 GPT-5.6 Luna보다 0.55배 적은 단어 수(문서당 384단어 대 703단어)를 작성했으며, 모든 80개 항목에서 더 짧았습니다. 포스트모템(postmortems)에서는 특히 짧았고(981단어 대비 441단어), 고객 답변(customer replies)에서는 가장 적었습니다(767단어 대비 576단어).
부분이 명명된 경우에는 격차가 사라집니다: 724단어 대 738단어.
기본적으로 짧은 것은 Luna에만 국한된 것이 아닙니다. 동일한 항목에서 GPT-6 Sol는 325단어 대 GPT-5.6 Sol의 592단어를 작성했으며, GPT-6.1 Sol은 다시 565단어로 돌아왔습니다.
GPT-6 Luna가 무언가를 빠뜨리는가?
목표 기반 프롬프트(goal-only prompts)를 사용할 때, GPT-6 Luna는 GPT-5.6 Luna보다 사후 분석 보고서(postmortem)에서 사고 기간을 누락하는 경향이 더 강했습니다. 일반적으로 시간 범위("사고 기간: 18:00-18:39 UTC")만 제공하고 나머지 계산은 독자에게 맡겼습니다. 다른 모든 요소들, 즉 모든 지역과 최악의 지역, 모든 이벤트, 그리고 none을 제외한 모든 티켓에 대한 이름으로 작성된 답변까지는 모든 노력 설정(effort setting)에서 존재했습니다.
| 목표 기반 프롬프트 | GPT-6 Luna 완전 버전 | 기간이 없는 GPT-6 Luna 사후 분석 보고서 | GPT-5.6 Luna 완전 버전 | 기간이 없는 GPT-5.6 Luna 사후 분석 보고서 |
|---|---|---|---|---|
none | 44 / 60 | 15 / 20 | 57 / 60 | 3 / 20 |
| ... |
none에서의 격차(57 대비 44)는 수정 후에도 유지됩니다. medium(58 대비 51)에서는 수정 전에만 유의미하며, 방향성으로 읽어야 하고, max에서는 두 모델이 동률입니다. 이 모든 것은 하나의 문서 유형에서 나온 것이므로, GPT-6 Luna가 사후 분석 보고서에서 파생된 수치를 건너뛰는 것일 뿐 일반적인 콘텐츠 누락 습관은 아니라는 것을 보여줍니다.
부분을 명시했을 때, GPT-6 Luna는 80개 중 74개의 문서에서 완전했으며, GPT-5.6 Luna도 69개로 동률이었습니다. 두 모델 모두 놓친 부분은 요청된 단어 범위 아래에 있는 메모 또는 영향(impact) 단락이었습니다: GPT-6 Luna의 경우 6개, GPT-5.6 Luna의 경우 11개였습니다.
길이와 세부 사항을 되돌리는 것은 무엇인가?
프롬프트에서 부분을 명시하는 것이 그러하며, 두 가지 요청 매개변수도 마찬가지입니다. 동일한 GPT-6 Luna를 같은 노력 수준으로 사용했을 때, 프롬프트가 기간을 요구하자 384단어에서 738단어로 늘어나면서 모든 사후 분석 보고서에 기간을 명시했습니다. 다음과 같은 요청만으로 충분합니다:
다음 섹션들로 사후 분석 보고서를 작성하세요: 타임라인(모든 이벤트를 포함하는 표), 영향(120-200 단어, 총 지속 시간을 분 단위로 명시), 근본 원인, 조치 항목(5개, 각각 "Owner: <팀>"으로 끝날 것), 배운 점(최소 3개의 글머리 기호).
text.verbosity는 응답(Responses) API 매개변수(low, medium, high)로, 표시되는 답변의 길이와 상세도를 결정합니다. 이 값을 high로 설정했을 때, GPT-6 Luna의 목표 전용 문서 길이는 7% 증가하여 410단어가 되었으며, 완전성(completeness)은 기존과 동일하게 52/60 대 51을 유지했습니다.
reasoning.effort를 높이면 모델이 얼마나 많이 쓰는가보다 얼마나 깊게 생각하는지에 영향을 미칩니다. none에서 max로 변경했을 때, GPT-6 Luna의 문서 길이는 370단어에서 436단어로 증가했으며, 추론(reasoning)은 답변당 0 토큰에서 4,192 토큰으로 늘었습니다. max 설정은 지속 시간(duration)을 회복시켰으나 (20개 중 1개 누락), 비용은 medium의 4.5배에 달했습니다.
두 매개변수 모두 OpenAI Python SDK를 통해 사용할 수 있습니다:
from openai import OpenAI
client = OpenAI()
...
output_tokens에는 추론 토큰이 포함되므로, 표시되는 답변은 이 두 숫자의 차이입니다.
GPT-6 Luna가 GPT-5.6 Luna 대비 얼마나 절약할 수 있나요?
동일한 문서를 기준으로 할 때, GPT-6 Luna는 GPT-5.6 Luna 대비 49% 저렴했습니다. 명시된 부분(parts named) 기준으로 1,000개 문서당 $0.81 대 $1.61이었습니다. 가격 절감만으로도 충분히 큰 차이가 있었습니다. GPT-5.6 Luna의 토큰을 GPT-6 Luna 요율로 재산정하면 $0.68로, 58% 적었으며, GPT-6 Luna의 답변 비용은 이보다 20% 더 비쌌습니다. 이는 GPT-6 Luna가 두 배 많은 추론(답변당 271 토큰 대 537 토큰)을 했고, 총 출력이 1,284토큰에서 1,558토큰으로 증가했기 때문입니다.
목표 전용 프롬프트(goal-only prompts)의 경우 청구서가 더 좋아져 1,000개 문서당 $0.54 대 $1.66 (68% 절감)이었지만, 추가적인 절감액 대부분은 GPT-6 Luna가 절반만 작성했기 때문이며, 이는 나머지 절반이 필요하지 않았을 때에만 해당되는 절약입니다.
속도는 거의 비슷했습니다. GPT-6 Luna는 전체 요청 시간당 115 출력 토큰/초를 생성한 반면, GPT-5.6 Luna는 125를 기록했으며, 목표 전용 문서는 적을 내용이 적었기 때문에 중앙값으로 각각 8.1초 대 11.1초가 소요되었습니다.
저희 결과가 다른 공개 테스트와 일치하나요?
저희의 결과는 중복되는 부분에서는 공공 벤치마크와 일치하며, 더 짧은 내용, 누락된 내용, 그리고 이를 수정하는 내용을 추가합니다.
| 질문 | 다른 곳에서 게재됨 | 우리의 측정치 | 판결 |
|---|---|---|---|
| 일반적인 능력: GPT-6 Luna 대 GPT-5.6 Luna | Artificial Analysis 38 대 37; Vals는 51.2% 대 51.7% | 이름이 지정된 부분을 포함하여 80개 중 74개와 69개를 완성, 동점 | 일치: 수준 |
| ... |
우리가 관찰한 점과 무엇을 사용해야 할까요?
프롬프트를 제어할 수 있고 필요한 부분이 이름으로 지정되는 곳에서는 GPT-6 Luna를 사용하고, 프롬프트 변경이 불가능하여 독자들이 긴 문서를 기대하는 경우에만 GPT-5.6 Luna를 유지하세요. 세 가지 관찰 결과가 이를 뒷받침합니다:
- GPT-6 Luna는 요청에 맞춰 작성합니다. 목표(goal)가 짧은 문서를 얻고, 부분 목록(list of parts)이 GPT-5.6 Luna와 일치하는 전체 문서를 얻습니다.
- 누락되는 부분이 좁습니다. 네 가지 문서 유형 전반에서 가장 자주 누락된 예상 항목은 사고 기간(incident duration)이었습니다.
- 절약되는 부분은 가격 인하입니다. 동일한 문서를 위해 21% 더 많은 출력 토큰을 사용하므로, 49% 절감액은 목록 가격만으로 얻는 58%보다 적습니다.
| 작업 부하 | 선택 | 수치 |
|---|---|---|
| 기계가 읽는 출력: 분류, 추출, 라우팅 | 정확도가 허용하는 가장 낮은 노력의 [GPT-6 Luna] | 목록 가격 기준 50% (입력) 및 58% (출력) 절감; 프로그램이 읽을 때는 답변 길이가 중요하지 않음 |
| ... | ||
| 고객에게 전달되는 문서는 어떤 모델이 작성했든 코드로 필수 요소를 확인하세요. |
FAQ
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기