
OpenAI, 공식 하네스를 우회한 커스텀 API를 통해 ARC-AGI-3에서 38.3% 기록
요약
OpenAI의 GPT-5.6 Sol이 커스텀 API 설정을 통해 ARC-AGI-3 벤치마크에서 38.3%를 기록하며 Opus 5를 앞질렀습니다. 그러나 공식 하네스에서는 7.8%에 그쳐, API 설정 방식에 따른 벤치마크 공정성 및 동등성 문제가 제기되었습니다.
핵심 포인트
- GPT-5.6 Sol은 커스텀 API 사용 시 38.3%, 공식 하네스 사용 시 7.8% 기록
- Retained Reasoning 및 Compaction 설정이 성능 차이의 핵심 요인
- 벤치마크 인프라가 모델의 순수 추론 능력이 아닌 기술적 설정을 측정할 위험성 존재
- François Chollet는 설정과 비용이 명확히 보고된다면 차이를 수용 가능하다고 언급
OpenAI의 GPT-5.6 Sol은 커스텀 API 설정을 통해 ARC-AGI-3에서 38.3%를 기록하며 Opus 5의 30.2%를 앞질렀으나, 공식 하네스(official harness)에서는 7.8%를 기록하여 벤치마크 동등성(parity) 문제를 드러냈습니다.
OpenAI의 GPT-5.6 Sol은 커스텀 API 설정을 통해 ARC-AGI-3에서 38.3%를 기록하며 Anthropic의 Opus 5(30.2%)를 능가했습니다. 하지만 공식 테스트 하네스(official test harness)에서 이 모델은 7.8%를 기록했으며, 이는 벤치마크 공정성에 대한 논쟁을 불러일으켰습니다.
주요 사실 (Key facts)
- GPT-5.6 Sol: 커스텀 API 사용 시 38.3%, 공식 하네스 사용 시 7.8%.
- Opus 5: ARC-AGI-3에서 30.2% 기록.
- ARC Prize의 공동 창립자인 François Chollet은 동등성(parity) 문제를 인정함.
- 공식 하네스는 OpenAI의 기능을 포함하지 않은 이전 버전의 API를 사용함.
- OpenAI는 Retained Reasoning 및 Compaction 설정을 사용함.
OpenAI는 바로 지난주 Anthropic의 Claude Opus 5가 장악했던 논리 벤치마크인 ARC-AGI-3에서 승리를 주장하고 있습니다. The Decoder에 따르면, GPT-5.6 Sol은 두 가지 커스텀 설정인 'Retained Reasoning'(단계 간 사고의 흐름(chain-of-thought)을 보존함)과 'Compaction'(이전 컨텍스트를 잘라내는 대신 요약함)을 적용한 OpenAI의 Responses API를 사용하여 38.3%를 달성했습니다. 이는 Opus 5의 30.2%를 앞서는 수치이지만, 중요한 주의 사항이 있습니다. 제공업체별 특화 기능 없이 표준화된 설정을 사용하는 공식 ARC-AGI-3 하네스에서 GPT-5.6 Sol은 단 7.8%를 기록했습니다.
이 격차는 프런티어 모델 (frontier models)을 평가하는 방식에 있어 구조적 긴장 상태가 존재함을 보여줍니다. ARC-AGI-3는 모델을 둘러싼 인프라가 아닌, 모델의 순수한 추론 능력을 측정하도록 설계되었습니다. 공식 하네스 (harness)는 공정한 비교 (apples-to-apples comparisons)를 보장하기 위해 API 레벨의 최적화를 제거합니다. OpenAI는 "벤치마크는 모델뿐만 아니라 모델을 둘러싼 기술적 설정도 측정한다"라고 주장하며, 이는 ARC Prize의 공동 창립자인 François Chollet도 부분적으로 인정한 부분입니다. Chollet는 성명을 통해 "벤치마크를 해결하기 위해 맞춤 제작된 하네스" (허용되지 않음)와 "ARC-AGI-3를 위해 개발되지 않았으며 모든 API 사용자에게 제공되는 범용 API 설정" (허용됨)을 구분했습니다. 그는 서로 다른 설정을 사용하는 다양한 제공업체들이 "잠재적인 형평성 문제 (parity issue)를 야기한다"는 점을 인정하면서도, "설정과 비용이 명확하게 보고되는 한" 수용 가능하다고 판단했습니다.
API 비대칭성 문제
진정한 핵심은 어떤 모델이 더 똑똑한가가 아니라, 벤치마크 인프라 자체가 더 이상 제공업체에 중립적이지 않다는 점입니다. 보도에 따르면 공식 ARC-AGI-3 하네스는 추론 유지 (retained reasoning)와 같은 기능이 결여된 구형 "OpenAI 스타일의 completions API"를 사용했는데, 이러한 기능은 이미 Claude API에서 제공하고 있었습니다. 이는 Anthropic의 Opus 5가 현재 OpenAI가 활용하고 있는 것과 유사한 API 레벨의 이점을 이미 누렸을 수도 있지만, OpenAI는 이전에 해당 기능을 갖추지 못해 사실상 불이익을 받았음을 의미합니다. Chollet는 "모델을 가장 잘 테스트하는 방법, 특히 압축 (compaction)과 관련하여 OpenAI와 많은 논의가 있었다"고 언급하며, 벤치마크 주최 측도 이러한 비대칭성을 인지하고 있으나 API 계층을 표준화하지는 못했음을 시사했습니다.
이는 ARC-AGI-3를 넘어선 문제입니다. 모델이 사고의 사슬 (chain-of-thought), 컨텍스트 관리 (context management), 에이전트 루프 (agentic loops)에 점점 더 의존함에 따라, 이러한 인프라의 차이를 고려하지 않는 모든 벤치마크는 모델의 능력만큼이나 API의 품질을 측정하게 될 위험이 있습니다. OpenAI의 38.3% 점수는 하나의 수치이지만, 동시에 단순한 단일 하네스 평가의 시대가 끝나가고 있다는 신호이기도 합니다.
점수가 실제로 의미하는 것
공식 하네스 (harness)에서 기록한 OpenAI의 7.8%는 API라는 지지대(crutch)가 없는 GPT-5.6 Sol의 순수 추론 (raw reasoning) 능력이 여전히 Opus 5보다 훨씬 낮다는 점을 상기시켜 줍니다. 하지만 38.3%라는 수치는 인프라가 정렬되었을 때 모델이 무엇을 할 수 있는지를 보여줍니다. 실무자들에게 주는 교훈은 벤치마크 점수가 점점 더 모델과 배포 스택 (deployment stack)의 결합 함수가 되어가고 있다는 점입니다. 설정과 비용이 투명해야 한다는 ARC Prize의 대응은 비교 가능성을 향한 한 단계이지만, 향후 평가를 위한 동등성 (parity) 문제를 해결하지는 못합니다.
이는 또한 더 넓은 트렌드의 일부이기도 합니다. OpenAI는 최근 GPT-5.6 Sol이 압축 (compaction)과 같은 API 수준의 기능이 중요한 또 다른 벤치마크인 DeepSWE에서 72.7%를 기록했다고 주장했습니다. 이전에 보도된 바와 같이, 이 회사는 단순히 모델이 할 수 있는 것을 넘어, API가 할 수 있는 것의 한계를 밀어붙이고 있습니다.
주목해야 할 점
동등성을 보장하기 위해 API 수준의 설정을 의무화할 수 있는 ARC Prize의 차기 표준화된 하네스 (harness) 버전을 주목하십시오. 또한, 기본적으로 추론 유지 (retained reasoning)를 포함하는 향후 API 업데이트 이후, OpenAI가 공식 하네스를 사용하여 ARC-AGI-3에서 GPT-5.6 Sol의 점수를 발표하는지 여부도 추적하십시오.
출처: the-decoder.com
[3월 31일 업데이트, openai_blog를 통해]
GPT-5.6 Sol의 ARC-AGI-3 성능 향상을 이끈 것과 동일한 효율성 추진력이 이제 대대적인 가격 인하를 주도하고 있습니다. 7월 30일부터 OpenAI는 GPT-5.6 Luna의 가격을 80% 인하(입력 100만 토큰당 $0.20, 출력 100만 토큰당 $1.20)하고, Terra의 가격을 20% 인하합니다. OpenAI에 따르면, 이는 추론 커널 (inference kernels) 및 부하 분산 (load balancing)을 최적화하여 서비스 비용을 20% 절감한 Sol의 공로 덕분입니다. [per OpenAI] Luna는 이제 Google의 Gemini 3.1 Flash-Lite보다 저렴하며, Anthropic의 Claude Haiku 4.5 입력 가격의 5분의 1 수준으로, 저비용 모델 시장의 지형을 재편하고 있습니다. 이는 벤치마크에서 나타난 API 레벨의 이점이 더 광범위한 인프라 효율성 전략의 일부임을 시사합니다.
원문 게시처: gentic.news
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기
