
GPT-5.6 등장과 2가지 설정으로 ARC-AGI-3 스코어가 3배가 된 이야기
요약
OpenAI가 지능과 효율을 동시에 잡은 신모델 GPT-5.6을 발표했습니다. 특히 API의 reasoning retention과 compaction 설정을 활성화하는 것만으로 ARC-AGI-3 벤치마크 점수를 3배 높일 수 있다는 실천적인 가이드를 제공합니다.
핵심 포인트
- GPT-5.6은 모델, 추론, 에이전트 워크플로우 레이어 전반에서 효율이 개선됨
- reasoning retention 설정으로 턴 간 추론 프로세스 유지 가능
- compaction 설정을 통해 장기 에이전트 태스크의 컨텍스트 효율화
- 코드 변경 없이 API 설정만으로 ARC-AGI-3 스코어 3배 향상 가능
2026년 7월 30일, OpenAI의 공식 뉴스에 GPT-5.6 관련 기사 2건이 공개되었습니다. 1건은 신모델 「GPT-5.6」이 지능과 효율을 양립시킨 프론티어 모델(Frontier Model)이라는 발표, 다른 1건은 API 측의 2가지 설정을 활성화하는 것만으로 ARC-AGI-3 벤치마크(Benchmark) 스코어가 3배가 되었다는 상당히 실천적인 내용입니다.
특히 후자는 이미 OpenAI API로 에이전트적인 워크플로우(Agentic Workflow, 여러 턴에 걸친 추론이나 도구 사용을 동반하는 태스크)를 구축하고 있는 개발자에게, 코드를 바꾸지 않고도 성능을 끌어올릴 수 있는 가능성이 있는 중요한 정보입니다. 본 기사에서는 이 2건을 정리하고, 개발자가 무엇을 해야 하는지 정리합니다.
📌 영향을 받는 사람
- OpenAI API의 Responses API로 에이전트적인 워크플로우를 구축하고 있는 사람
- GPT-5.6(또는 그 이전의 GPT 모델)을 장시간 태스크·멀티 턴(Multi-turn) 추론에 사용하고 있는 사람
- 비용 효율성을 중시하여 모델 선정을 재검토하고 싶은 프로덕션(Production) 팀
이번 2가지 발표는 다음과 같은 관계를 맺고 있습니다. GPT-5.6이라는 신모델의 효율 개선이라는 큰 발표와, 그 API 설정을 실제로 어떻게 사용하면 효과가 나타나는지에 대한 구체적인 지견이 한 쌍을 이룹니다.
또한, ARC-AGI-3 스코어 향상의 메커니즘은 요청(Request)의 흐름으로 보면 이해하기 쉽습니다.
이번 2건의 발표를 표로 정리합니다.
| 항목 | GPT-5.6의 프론티어 효율 발표 | ARC-AGI-3 스코어 3배화 지견 |
|---|---|---|
| Severity | High | Medium |
| ... |
OpenAI는 GPT-5.6이 「프론티어급 지능」과 「프론티어급 효율」을 융합시킨 모델이라고 발표했습니다. 효율 개선은 다음 3가지 레이어(Layer)에서 이루어지고 있다고 합니다.
모델 레이어(Model Layer): 모델 자체의 아키텍처·학습의 효율화 -
추론(Inference) 레이어: 추론 처리 그 자체의 효율화 -
에이전트적 워크플로우 레이어(Agentic Workflow Layer): 멀티 턴·도구 사용을 동반하는 태스크에서의 효율화
이러한 결과로 「1달러당 유용한 지능(useful intelligence per dollar)」이 향상된다고 하며, 비용 효율을 중시하는 프로덕션 용도에서는 모델 선정을 재검토하는 재료가 될 것 같습니다.
다른 한 건의 기사에서는 GPT-5.6을 ARC-AGI-3 벤치마크(여러 단계의 추론·탐색을 요하는 난이도 높은 벤치마크)에서 평가할 때, 다음과 같은 2가지 API 설정을 활성화함으로써 스코어가 3배가 되었다고 보고되었습니다.
reasoning retention (추론 내용의 유지): 모델의 추론 내용을 턴을 넘어서 유지하여, 이전의 사고 프로세스를 이어받을 수 있도록 하는 설정 -
compaction (컴팩션): 장시간의 에이전트적 태스크에서 컨텍스트(Context)를 효율적으로 관리·압축하는 설정
이 두 가지를 조합함으로써 스코어 향상뿐만 아니라 효율 면에서의 개선도 보였다고 합니다.
💡 Tips
에이전트적인 태스크(여러 턴에 걸친 조사·도구 호출·단계적인 문제 해결 등)를 API를 통해 구현하고 있는 경우, 이 2가지 설정이 활성화되어 있는지 먼저 확인하는 것을 추천합니다. 코드 자체를 크게 변경하지 않고도 성능 개선을 기대할 수 있습니다.
action_required 가 true로 되어 있는 것은 「ARC-AGI-3 스코어 3배화」 설정에 관한 항목입니다. 다음 흐름에 따라 대응을 판단해 주세요.
대응 우선순위를 정리하면 다음과 같습니다.
즉시 확인해야 할 것: 자사의 에이전트 구현에서 reasoning retention과 compaction이 활성화되어 있는지 -
중기적으로 검토해야 할 것: GPT-5.6으로의 이행에 따른 비용 효율(1달러당 지능)의 재평가 -
CLAUDE.md 등의 운영 문서: 「장시간의 에이전트적 태스크에서는 reasoning retention과 compaction을 활성화하면 성능·효율이 크게 개선되는 경우가 있다」는 취지를 추가해 두면 팀 전체에 공지하는 데 도움이 됩니다
Responses API로 멀티 턴의 에이전트적 태스크를 실행할 때, reasoning retention과 compaction에 관련된 설정을 의식한 구현 이미지는 다음과 같습니다 (구체적인 파라미터 명은 공식 문서의 최신 사양을 확인해 주세요).
Before (설정을 의식하지 않은 구현)
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
...
After (추론 유지와 컴팩션 (Compaction)을 의식한 구현)
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
...
⚠️ Breaking Change
위 내용은 설정의 개념을 보여주는 샘플이며, 실제 파라미터 명칭 및 구조는 변경될 가능성이 있습니다. 운영 코드에 반영할 때는 OpenAI의 최신 API 레퍼런스에서 정확한 필드명을 확인해 주세요.
- OpenAI는 GPT-5.6을 "프론티어급 지능과 효율을 양립한 모델"로 발표하였으며, 모델, 추론, 에이전트적 워크플로우의 각 레이어에서 효율을 개선했다고 밝혔습니다.
- 동시에, Responses API의 **reasoning retention (추론 유지)**와 **compaction (컴팩션)**이라는 두 가지 설정을 활성화하는 것만으로 ARC-AGI-3 벤치마크 스코어가 3배가 되었다는 지견도 공개되었습니다. - 이미 GPT-5.6으로 에이전트적 워크플로우를 구축하고 있는 개발자는 우선 이 두 가지 설정이 활성화되어 있는지 확인하는 것을 권장합니다.
- 비용 효율성 (1달러당 유용한 지능)을 중시하는 팀은 GPT-5.6으로의 전환이나 모델 선정의 재검토를 고려할 가치가 있습니다.
코드의 대규모 변경 없이도 성능 개선을 기대할 수 있는 설정이므로, 해당 사항이 있는 분들은 한 번 확인해 보시기 바랍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기