OpenAI, AI 벤치마크 점수는 하네스(Harness), 예산 및 메모리 설계에 따라 달라진다고 밝혀
요약
OpenAI는 AI 벤치마크 점수가 모델의 절대적 능력이 아닌, 평가 환경(하네스), 리소스 예산, 도구 접근성에 따라 달라지는 가변적 측정값임을 강조합니다. 따라서 평가 시 구체적인 설정 조건과 변수를 투명하게 공개해야 한다는 가이드라인을 제시했습니다.
핵심 포인트
- 벤치마크 점수는 특정 하네스와 예산 하에서의 성능으로 해석해야 함
- 에이전트 평가 시 도구 사용, 메모리 관리 등 구현 세부 사항이 결과에 큰 영향
- 평가 시 하네스 구성, 컴퓨팅 자원, 도구 접근성 등의 변수 공개 필수
- 강력한 유도, 통제된 비교, 안전 장치 견고성 등 평가 주장의 분류 체계 도입
OpenAI는 연구자, 평가자 및 AI 구매자들이 벤치마크 결과를 모델의 독립적인 능력에 대한 영구적인 척도가 아닌, 특정 설정에서의 모델 측정값으로 취급할 것을 촉구하고 있습니다. 제3자 평가에 관한 OpenAI의 새로운 가이드라인에 따르면, 하네스(harness), 리소스 예산(resource budget), 사용 가능한 도구, 그리고 메모리 및 컨텍스트 관리 방식은 특히 장기 실행되는 다단계 작업에서 관찰된 성능을 실질적으로 변화시킬 수 있습니다.
OpenAI의 신뢰할 수 있는 제3자 평가에 관한 가이드라인에서, 회사는 점수 뒤에 숨겨진 조건에 대해 더 명확한 보고를 요구합니다. 핵심 메시지는 간단합니다. 모델의 결과가 더 많은 컴퓨팅(compute), 더 나은 도구 접근성, 또는 더 유능한 에이전트 하네스(agent harness)와 함께 개선될 때, 해당 결과는 해당 하네스와 예산 하에서의 성능으로 기술되어야 합니다. 이를 고정된 능력의 상한선으로 제시해서는 안 됩니다.
프런티어(frontier) AI 시스템이 단발성 채팅 시스템보다는 에이전트(agent)로서 점점 더 많이 평가됨에 따라 이러한 구분은 중요해지고 있습니다. 에이전트는 유용한 정보를 유지하고, 도구를 선택 및 사용하며, 실패한 단계로부터 복구하고, 확장된 작업 전반에 걸쳐 컨텍스트를 관리해야 할 수도 있습니다. 이러한 경우, 평가 설계는 사소한 구현 세부 사항이 아닙니다. 그것은 결과를 결정하는 요소의 일부입니다.
AI 벤치마크 결과가 가변적인 이유
하네스는 측정의 일부입니다
하네스(harness)는 평가를 실행하는 데 사용되는 운영 설정입니다. 실제로 이는 모델이 작업을 받는 방식, 사용할 수 있는 도구, 허용되는 단계 또는 시도 횟수, 상태(state)를 보존할 수 있는지 여부, 그리고 출력이 어떻게 평가되는지를 결정할 수 있습니다. OpenAI의 가이드라인은 하네스를 예산 및 도구와 함께 평가자가 공개해야 할 핵심 변수로 규정하고 있습니다.
이것이 벤치마크 결과가 무용하다는 의미는 아닙니다. 오히려 결과를 더 해석 가능하게(interpretable) 만들어 줍니다. 점수는 특정 환경에서의 성능에 대한 강력한 증거를 제공할 수 있습니다. 하지만 두 모델이 실질적으로 다른 프롬프팅 (prompting), 도구 (tools), 시간 또는 연산 허용량 (compute allowances), 메모리 동작 (memory behavior), 또는 안전 제약 조건 (safety constraints) 하에서 테스트될 경우, 비교의 신뢰성은 떨어지게 됩니다.
OpenAI는 이러한 보고 문제를 평가 주장 (evaluation claims)의 분류 체계를 통해 정의합니다. OpenAI는 이를 강력한 유도 (strong elicitation), 통제된 비교 (controlled comparison), 그리고 **안전 장치 견고성 (safeguarding robustness)**으로 구분합니다. 각 주장은 서로 다른 증거를 필요로 합니다. 한 시스템으로부터 가능한 가장 강력한 성능을 유도하도록 설계된 평가는, 시스템 간의 통제된 비교가 자동으로 성립되는 것은 아닙니다. 마찬가지로, 적대적 조건 (adversarial conditions) 하에서 안전 장치가 유지되는지에 대한 결과는 능력 벤치마크 (capability benchmark)와는 다른 질문에 답하는 것입니다.
| 평가 요소 | 단일 점수가 가릴 수 있는 것 | OpenAI가 보고해야 한다고 말하는 것 |
|---|---|---|
| 하네스 (Harness) | 모델이 어떻게 실행되었고 작업을 통해 어떻게 유도되었는지 | 평가에 사용된 하네스 구성 (harness configuration) |
| ... |
실질적인 결과는 벤치마크 보고가 리더보드 스타일의 숫자를 넘어선 단계로 나아가야 한다는 것입니다. 독자들은 무엇이 테스트되었는지, 어떻게 유도되었는지, 그리고 해당 측정값이 무엇을 정당하게 뒷받침할 수 있는 결론인지 이해할 수 있는 충분한 정보가 필요합니다.
장기 실행 에이전트는 컨텍스트 관리의 중요성을 더 높입니다
OpenAI는 이 문제의 구체적인 사례로 GPT-5.5 사이버 레인지 (cyber-range) 평가를 언급합니다. OpenAI는 평가 하네스가 턴(turn) 전반에 걸쳐 작업 관련 컨텍스트 (context)를 보존하기 위해 **압축 (compaction)**을 사용했을 때 성능이 향상되었다고 밝혔습니다. 장기적 작업 (long-horizon task)의 경우, 이러한 능력은 에이전트가 상호작용이 진행됨에 따라 중요한 상태 (state)를 반복적으로 잃어버리는 대신, 이미 수집한 정보를 바탕으로 작업을 수행하는 데 도움을 줄 수 있습니다.
이 예시는 왜 메모리 전략 (memory strategy)이 지속 가능한 AI 시스템 (persistent AI systems)에 있어 의미 있는 평가 변수인지 강조합니다. 많은 단계를 거쳐 작동하는 모델은 이전의 발견 사항, 도구 출력 (tool outputs), 결정 사항 및 미결 업무를 추적해야 할 수도 있습니다. 만약 모델의 설정이 유용한 컨텍스트 (context)를 효과적으로 유지하지 못한다면, 관찰된 실패는 기반이 되는 모델만큼이나 주변 시스템을 반영하는 것일 수 있습니다.
이는 사이버 레인지 (cyber-range) 및 기타 다단계 평가 (multi-step evaluations)와 특히 관련이 깊으며, 여기에서의 성공은 단 하나의 정답을 내놓는 것보다 시간이 지남에 따라 행동을 순차적으로 배치하는 것에 달려 있을 수 있습니다. 이는 또한 배포 계획 (deployment planning)에도 영향을 미칩니다. 확장된 워크플로 (workflows)를 위해 에이전트 (agent)를 평가하는 조직은 단순히 발표된 모델 점수만을 통해 추론하기보다, 컨텍스트 처리 (context handling) 및 도구 사용 (tool use)을 포함한 전체 운영 설계를 테스트해야 합니다.
지속 가능한 AI 워크플로 (persistent AI workflows)를 구축하는 팀에게 평가 질문은 따라서 두 가지입니다. 어떤 모델이 사용되고 있는가, 그리고 어떤 시스템이 해당 모델이 시간이 지남에 따라 작업을 수행할 수 있도록 지원하는가? 이러한 선택지를 평가하는 조직은 Scalevise와 협력하여 실제 운영 제약 조건에 맞춰 설계된 AI 아키텍처 (AI architecture), 워크플로 자동화 (workflow automation) 및 구현에 대해 논의할 수 있습니다.
신뢰할 수 있는 평가 보고서가 보여주어야 할 것
OpenAI의 가이드는 또한 제3자 평가에서의 더 큰 표준화를 요구하는 촉구이기도 합니다. 이 회사는 보상 해킹 (reward hacking), 오염 (contamination), 거부 (refusals)를 포함하여 겉으로 드러나는 결과를 왜곡할 수 있는 몇 가지 위험 요소를 식별합니다. 이러한 문제들은 평가 설계와 증거가 투명하지 않다면, 높은 점수를 오해의 소지가 있게 만들거나 낮은 점수를 해석하기 어렵게 만들 수 있습니다.
유용한 평가 보고서는 다음 사항을 명확히 해야 합니다:
- 모델을 실행하고 작업을 관리하는 데 사용된 하네스 (harness);
- 실행에 적용된 리소스 또는 컴퓨팅 예산 (compute budget);
- 시스템이 사용할 수 있는 도구 (tools);
- 턴(turn) 간의 메모리 (memory), 컨텍스트 (context) 및 상태 (state)에 대한 접근 방식;
- 마련된 안전장치 (safeguards) 및 명시된 주장을 뒷받침하는 증거.
이러한 수준의 공개는 다양한 이해관계자들이 더 나은 질문을 던질 수 있도록 돕습니다. 연구자들은 결과가 통제된 비교 (controlled comparison)를 지원하는지 판단할 수 있습니다. 개발자들은 성능을 재현하는 데 필요할 수 있는 운영 조건 (operational conditions)을 식별할 수 있습니다. 기업 구매자들은 모델의 잠재력과 이를 실제 운영 환경 (production)에서 달성하기 위해 필요한 비용 및 엔지니어링 작업 사이를 구분할 수 있습니다.
또한 이는 비용을 논의하는 더 규율 있는 방식을 제공합니다. 만약 에이전트가 더 큰 예산이나 더 정교한 하네스를 사용할 때 더 나은 성능을 보인다면, 그 개선은 가치가 있을 수 있지만, 그것이 무료이거나 자동으로 이루어지는 것은 아닙니다. 배포 결정은 헤드라인 점수를 실제 운영 성능에 대한 직접적인 예측으로 취급하기보다는, 관련 평가에서 사용된 리소스, 도구 및 컨텍스트 관리 설계를 고려해야 합니다.
자주 묻는 질문 (Frequently Asked Questions)
OpenAI는 왜 AI 벤치마크 점수가 하네스 (harness)에 따라 달라진다고 말하나요?
하네스는 작업 설정, 도구, 예산 및 컨텍스트 관리와 같은 요소를 포함하여 평가 중에 모델이 실행되는 방식을 제어합니다. 이러한 선택은 관찰된 성능에 실질적인 영향을 미칠 수 있습니다.
하네스와 예산 하에서의 성능은 무엇을 의미하나요?
이는 결과가 특정 평가 설정 및 리소스 할당 하에서 모델이 어떻게 작동했는지를 설명함을 의미합니다. 이를 모든 환경에서 모델의 능력을 나타내는 고정된 척도로 취급해서는 안 됩니다.
압축 (compaction)이 GPT-5.5 사이버 레인지 (cyber-range) 평가에 어떤 영향을 미쳤나요?
OpenAI에 따르면, 평가 하네스가 턴 간에 작업 관련 컨텍스트를 보존하기 위해 압축 (compaction)을 사용했을 때 GPT-5.5가 더 나은 성능을 보였습니다.
제3자 AI 평가는 무엇을 공개해야 합니까?
OpenAI는 독자들이 결과를 적절하게 해석하고 비교할 수 있도록 평가에 사용된 하네스 (harness), 예산 (budget), 도구 (tools), 안전장치 (safeguards) 및 근거를 보고할 것을 권장합니다.
결론
OpenAI의 가이드는 벤치마크 해석의 틀을 전체 평가 환경 중심으로 재설정합니다. 특히 장기 실행 에이전트 (long-running agents)의 경우, 메모리 (memory), 도구 (tools), 예산 (budgets) 및 하네스 (harness) 설계가 모델 자체만큼이나 결정적으로 결과에 영향을 미칠 수 있습니다. 더욱 투명한 보고 방식은 제3자 평가가 연구자, 개발자, 그리고 실제 워크플로에서 AI 시스템이 어떻게 작동할지 결정해야 하는 조직들에게 더욱 유용한 정보를 제공하게 될 것입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기