OpenAI, 두 가지 API 설정으로 GPT-5.6 Sol의 ARC-AGI-3 점수를 3배 높였다고 발표
요약
OpenAI는 새로운 API 설정인 retained reasoning과 compaction을 통해 GPT-5.6 Sol의 ARC-AGI-3 점수를 13.3%에서 38.3%로 대폭 향상시켰습니다. 이는 모델 자체의 성능보다 소프트웨어 하네스의 구성이 벤치마크 결과와 토큰 효율성에 결정적인 영향을 미칠 수 있음을 보여줍니다.
핵심 포인트
- retained reasoning 설정을 통해 작업 간 추론 유지 능력 향상
- compaction 설정을 통해 출력 토큰 사용량 약 6배 감소
- 벤치마크 점수가 모델 가중치뿐만 아니라 API 구성에 의존함을 시사
- 에이전트 구축 시 컨텍스트 관리와 토큰 효율성의 중요성 강조
OpenAI는 두 가지 Responses API 설정인 retained reasoning과 compaction을 통해 GPT-5.6 Sol의 공개 세트 ARC-AGI-3 점수를 13.3%에서 38.3%로 끌어올렸다고 밝혔습니다. 이 결과는 벤치마크 결과가 낮게 나온 원인이 모델 자체보다는 모델을 실행하는 데 사용된 소프트웨어 하네스(software harness)에 있다는 점을 시사하기 때문에 중요합니다. 또한 OpenAI는 이 설정을 통해 출력 토큰(output tokens)이 약 6배 감소했다고 보고했습니다.
이 회사는 이전에 GPT-5.6 Sol이 공개된 수학 문제 해결을 포함한 고급 수학 작업이 가능하다고 제시한 바 있습니다. 그러나 ARC-AGI-3 조사 결과, 기존의 평가 설정이 모델이 벤치마크의 2D 퍼즐 게임을 수행하는 동안 학습한 내용을 유지하지 못하게 만들고 있음이 발견되었습니다. OpenAI의 상세한 ARC-AGI-3 보고서에서 회사는 API 구성이 에이전트의 성능과 토큰 효율성 모두에 실질적인 영향을 미칠 수 있다고 주장합니다.
이는 단순히 더 높은 벤치마크 수치를 얻은 것이 아니라, 중요한 배포(deployment) 교훈을 제공합니다. 여러 단계에 걸쳐 추론해야 하는 에이전트를 구축하는 개발자들에게 있어, 주변 시스템은 유용한 중간 작업이 지속될지, 컨텍스트(context)가 어떻게 관리될지, 그리고 결과를 도출하기 위해 얼마나 많은 출력이 소비될지를 결정합니다.
하네스가 결과를 바꾼 이유
ARC-AGI-3는 에이전트가 행동을 시도하고, 결과를 관찰하며, 접근 방식을 조정해야 하는 환경인 상호작용형 2D 퍼즐 게임을 중심으로 설계되었습니다. OpenAI의 분석에 따르면, 초기 하네스는 메모리 관련 제한 사항을 생성했습니다. 즉, GPT-5.6 Sol이 이전 작업으로부터 관련된 추론(reasoning)을 효과적으로 전달할 수 없었던 것입니다.
회사는 해결책으로 두 가지 Responses API 설정을 확인했습니다:
- Retained reasoning (추론 유지): OpenAI에 따르면, 이 설정은 모델이 상호작용 사이에 유용한 작업 내용을 잃어버리는 대신 작업 전반에 걸쳐 추론을 보존할 수 있게 해줍니다.
- Compaction (압축): OpenAI에 따르면, 이는 출력 토큰 (output-token) 사용량을 줄이면서 컨텍스트 (context)를 관리하는 데 도움을 줍니다.
- The Responses API: OpenAI가 이 구성을 위한 권장 인터페이스로 지정한 API입니다.
이러한 차이는 벤치마크 해석에 있어 중대한 영향을 미칩니다. 에이전트 하네스 (agent harness)를 통해 생성된 점수는 모델, API 설정, 작업 루프 (task loop), 그리고 평가 절차의 결합된 동작을 반영합니다. 이는 단순히 기저에 있는 모델 가중치 (model weights)만을 측정하는 것이 아닙니다.
| 보고된 측정치 | 초기 하네스 (Initial harness) | 추론 유지 및 압축이 적용된 하네스 |
|---|---|---|
| GPT-5.6 Sol public-set ARC-AGI-3 점수 | 13.3% | 38.3% |
| ... | ... | ... |
운영상의 함의를 갖는 벤치마크 결과
OpenAI가 보고한 개선 사항은 신뢰성과 비용을 연결합니다. 만약 에이전트가 유지될 수 있었던 추론을 반복적으로 재구성한다면, 일관성은 떨어지면서 더 많은 토큰을 소비할 수 있습니다. 반대로, 관련 작업을 보존하고 컨텍스트를 관리하면 모델이 더 적은 생성 토큰을 사용하면서도 작업을 더 효과적으로 계속 수행할 수 있습니다.
이것이 해당 설정이 모든 워크로드 (workload)를 자동으로 동일한 양만큼 개선한다는 의미는 아닙니다. 13.3%에서 38.3%로의 변화는 OpenAI의 평가 구성 하에 ARC-AGI-3 퍼블릭 세트 (public set)에서 보고된 결과입니다. 이를 모든 애플리케이션, 모델 또는 벤치마크에 적용되는 보편적인 승수로 취급해서는 안 됩니다.
또한 이를 모든 ARC-AGI-3 결과와 혼동해서도 안 됩니다. 제공된 ARC Prize 리더보드 문맥에 따르면 Sol Max의 퍼블릭 ARC-AGI-3 데모 점수는 7.78%로 인용되어 있습니다. 서로 다르게 보고된 점수들은 서로 다른 모델, 모드, 하네스 또는 평가 조건을 반영할 수 있습니다. 따라서 결과를 비교하는 개발자는 결론을 내리기 전에 정확한 모델 구성, API 워크플로 (workflow), 작업 세트, 그리고 점수 산정 환경을 확인해야 합니다.
개발자가 OpenAI의 발견에서 취해야 할 점
실질적인 시사점은 단순히 모델 선택뿐만 아니라 애플리케이션 스택 (application stack)을 테스트해야 한다는 것입니다. 에이전트 루프 (agent loop)에서 성능이 저조해 보이는 모델은 상태 (state)와 컨텍스트 (context)가 처리되는 방식에 의해 제약을 받고 있을 수 있습니다. OpenAI가 권장하는 구성은 구체적으로 추론 유지 (retained reasoning) 및 압축 (compaction) 기능이 활성화된 Responses API를 사용하는 것입니다.
추론 모델 (reasoning models)을 평가하는 팀은 다음과 같은 체계적인 프로세스를 포함해야 합니다:
- 작업 품질과 토큰 사용량을 함께 측정할 것;
- 턴 (turns) 사이에서 중간 추론 (intermediate reasoning) 또는 작업 상태 (task state)가 보존되는지 테스트할 것;
- 벤치마크 결과와 함께 API 설정을 문서화할 것;
- 단일 공개 벤치마크로부터 추론하는 대신, 팀 고유의 워크플로 (workflow)에서 결과를 검증할 것.
프로덕션 환경을 위한 추론 에이전트 (reasoning agents)를 평가하는 조직은 주변 시스템의 컨텍스트, 상태 및 비용 제어와 함께 모델 동작을 평가하는 **AI 아키텍처, 워크플로 자동화 및 API 통합**에 대해 Scalevise와 협력할 수 있습니다.
OpenAI의 더 광범위한 GPT-5.6 Sol 자료는 왜 ARC-AGI-3 결과가 주목을 받았는지에 대한 유용한 맥락을 제공합니다. 이 회사는 수학 중심의 모델 출력물을 문서화했으며, 평면에서의 단위 거리 문제 (unit-distance problem)와 관련된 이산 기하학 (discrete-geometry) 결과와 관련된 자료를 발표했습니다. 해당 주장들은 다른 클래스의 추론 작업에 관한 것이지만, ARC-AGI-3 조사에서 얻은 핵심 교훈을 강화합니다. 즉, 한 환경에서의 강력한 능력이 에이전트 하네스 (agent harness)가 다른 환경에서 그 능력을 효과적으로 드러낼 것을 보장하지는 않는다는 점입니다.
자주 묻는 질문 (Frequently Asked Questions)
OpenAI는 어떤 API 설정이 GPT-5.6 Sol의 ARC-AGI-3 점수를 향상시켰다고 밝혔나요?
OpenAI는 Responses API의 추론 유지 (retained reasoning) 및 압축 (compaction) 기능을 확인했습니다. 이 두 설정을 활성화함으로써 GPT-5.6 Sol의 공개 세트 ARC-AGI-3 점수가 13.3%에서 38.3%로 증가했다고 밝혔습니다.
새로운 ARC-AGI-3 구성은 토큰 사용량을 얼마나 줄였나요?
OpenAI는 해당 구성이 공개 세트 (public-set) 점수를 개선하는 동시에 출력 토큰 (output tokens)을 약 6배 줄였다고 보고했습니다.
38.3%라는 결과가 모든 GPT-5.6 Sol 사용 사례에 적용되나요?
아니요. 이 수치는 특정 하네스 (harness) 구성 환경에서 ARC-AGI-3 공개 세트에 대해 OpenAI가 보고한 결과입니다. 다른 작업이나 배포 환경에서도 동일한 개선이 이루어진다는 것을 입증하지는 않습니다.
왜 API 하네스가 AI 벤치마크 점수에 영향을 미칠 수 있나요?
에이전트 하네스 (agent harness)는 모델이 컨텍스트 (context)를 받는 방식, 작업 내용을 유지하는 방식, 행동을 취하는 방식, 그리고 작업을 지속하는 방식을 제어합니다. OpenAI는 이전 설정이 GPT-5.6 Sol이 ARC-AGI-3 작업 중에 학습한 내용을 유지하도록 하지 못했다는 점을 발견했습니다.
결론
OpenAI의 ARC-AGI-3 분석은 에이전트의 성능이 모델 주변의 실행 환경 (execution environment)에 크게 의존할 수 있음을 보여줍니다. GPT-5.6 Sol의 경우, 유지된 추론 (retained reasoning)과 압축 (compaction)이 실질적으로 더 높은 공개 세트 점수 및 더 낮은 출력 토큰 사용량과 연관되어 있었습니다. 이 결과는 의미 있는 모델 평가를 위해서는 단순히 모델 이름뿐만 아니라 하네스 (harness) 및 API 구성에 대한 명확한 보고가 필요하다는 점을 강력하게 상기시켜 줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기