UK AISI와 EvalEval이 벤치마크 결과 재현성을 높이는 방법
요약
AISI와 EvalEval은 모델 성능 평가의 재현성 문제를 해결하기 위해 협력하여 'Every Eval Ever (EEE)' 스키마를 구축하고, 이를 위한 개방형 플랫폼인 Evaluation Cards를 공개했습니다. 이 릴리스에는 HealthBench, SWE-Bench Pro 등 주요 벤치마크에 대한 최첨단 모델(Claude Opus 시리즈, GPT-5 시리즈)의 검증된 결과가 포함되어 있습니다. 이러한 공유 인프라는 평가 보고의 투명성을 높이고, 연구자들이 성능을 맥락 속에서 해석할 수 있는 표준화된 기준점을 제공합니다.
핵심 포인트
- AISI와 EvalEval은 재현성 확보를 위해 EEE 스키마 및 Evaluation Cards를 구축했습니다.
- HealthBench, SWE-Bench Pro 등 5개 주요 벤치마크의 검증 결과를 공개했습니다.
- 최신 LLM(Claude Opus/GPT-5)의 성능을 추론 컴퓨팅과 평가 프로토콜에 따라 분석합니다.
- 공유 인프라는 연구자들이 결과의 맥락적 해석 및 비교를 가능하게 합니다.
AISI와 EvalEval은 이전에 NeurIPS 2025과 함께 열린 공동 워크숍에서 시작된 연구를 협력해 왔으며, Institute의 피드백은 Every Eval Ever (EEE) 스키마을 형성하는 데 도움을 주었습니다. 이번 협력의 다음 단계는 이러한 공유 인프라를 실제로 적용하는 것입니다.
AI 배포가 가속화됨에 따라, 평가는 모델 및 시스템 성능에 대한 점점 더 중요한 증거 출처가 되고 있습니다. 하지만 결과들은 많은 형식, 플랫폼, 매체를 통해 보고되며, 종종 재현하기에 충분한 정보가 부족합니다. 평가를 다시 실행하는 것 자체가 감당할 수 없을 정도로 비쌀 수도 있습니다.
EvalEval의 임무는 공유 보고 스키마인 Every Eval Ever와 평가 결과를 해석하는 데 필요한 정보를 공통 구조로 가져오는 개방형 플랫폼인 Evaluation Cards를 통해 이 생태계를 개선하는 것입니다.
이는 AISI가 OptStop을 통해 평가를 더 효율적으로, HiBayES를 통해 더 통계적으로 엄격하게, 그리고 스크립트 분석 및 역량 추출(capability elicitation)과 같은 영역에서 더 표준화되도록 만든 작업에 자연스럽게 기반합니다. 함께 AISI와 EvalEval은 평가 보고의 격차를 진단하고 이를 메우기 위한 공유 인프라를 구축하기 위해 노력하고 있습니다.
스크립트 수준의 투명성은 재현성뿐만 아니라 분석 및 진단에도 중요합니다. 이번 협력의 새로운 단계에서, AISI는 적절한 경우 공개적으로 보고된 평가 방법과 결과를 Evaluation Cards를 통해 제공할 예정입니다. 이 릴리스에는 논문의 주요 실험에 사용된 다섯 가지 벤치마크에 대한 검증된 결과, 맥락 및 구성 정보가 포함됩니다:
- HealthBench
- FrontierMath
- Humanity's Last Exam
- SWE-Bench Pro
- Terminal-Bench 2.0
이 결과들은 Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2, 그리고 GPT-5.4의 여섯 가지 최첨단 모델을 다룹니다. 이번 발표에는 또한 부분적으로 중복되는 다른 세트의 모델을 사용하는 두 개의 관련 사이버 평가—Cyber CTFs와 The Last Ones—의 결과도 포함됩니다. 이 데이터는 AISI의 논문 How Inference Compute Shapes Frontier LLM Evaluation과 함께 제공되는데, 이 논문은 벤치마크 성능이 추론 시간 컴퓨팅(inference-time compute) 및 평가 프로토콜에 따라 어떻게 달라지는지를 연구합니다.
Humanity's Last Exam에서의 성능은 평가 프로토콜과 추론 컴퓨팅에 따라 변화합니다. 각 곡선은 주어진 토큰 수 내에서 시도된 작업 중 해결한 누적 비율을 보여주며, 이는 작업별로 관찰된 가장 빠른 성공을 사용합니다. 모델들이 매번의 시도 후에 오라클(oracle)로부터 정확성 피드백을 받을 때, 토큰 사용량이 증가함에 따라 추가적인 작업을 계속해서 해결했습니다.
결과가 설정 정보와 함께 공개적으로 발표되면, 연구자와 실무자들은 개별 연구를 더 면밀히 검토하고 광범위한 생태계 전반에서 발견된 결과들을 비교할 수 있습니다. 다른 보고서들이 이러한 세부 정보를 부족할 때, AISI와 같은 발표는 평가를 맥락 속에서 해석하기 위한 검증된 기준점(reference points)을 제공합니다. 예를 들어, 연구자들이 설정 선택이 보고된 성능에 어떻게 영향을 미칠 수 있는지 이해하는 데 도움을 줄 수 있습니다. 더 많은 평가자들이 EEE를 채택함에 따라, 이와 같은 공개적인 비교는 보다 광범위하고 신뢰할 수 있는 메타 연구(meta-research)를 지원할 수 있습니다.
AISI의 Terminal-Bench 2.0 결과와 동일한 모델들에 대한 다른 보고된 평가들을 다양한 평가 설정 하에서 보여줍니다.
저희는 이러한 채택에 대해 기대하며, AISI 및 기타 AI 평가 기관들과 함께 평가 표준화 및 공유를 더욱 진행하기를 고대합니다.
모델 개발자: 검증된 평가 결과를 보고하세요. 평가 개발자: Every Eval Ever 스키마를 사용하여 벤치마크와 실행 데이터를 보고하세요. 평가, 거버넌스 및 정책 연구원: 벤치마크별 또는 모델별로 평가 카드(Evaluation Cards)를 탐색하거나, 이를 사용하여 전체적인 평가 보고 상태를 검토하세요.
EvalEval Coalition은 평가 생태계를 위한 과학적으로 근거한 연구와 견고한 배포 인프라를 개발하는 연구 커뮤니티입니다. 이의 목표는 평가 과학을 개선하고, 평가 적용 가능성 및 유용성을 문서화하는 것에 대한 합의 부족 문제를 해결하며, 과학적 연구 및 정책 분석에 중요한 영향을 포괄적으로 다루는 것입니다.
이 연합체의 주요 프로젝트에는 평가 결과에 대한 공유 스키마 및 저장소인 Every Eval Ever와 벤치마크 메타데이터, 평가 실행 데이터, 모델 메타데이터를 해석 가능한 기록으로 결합한 Evaluation Cards가 포함됩니다. 이들은 함께, 표면적으로 유사해 보이는 점수들이 의미 있게 다른 조건 하에서 생성되었을 때 이해하기 쉽게 만듭니다.
UK AI Security Institute는 영국 정부의 과학, 혁신 및 기술부(Department for Science, Innovation and Technology) 산하 연구 기관입니다. 그 임무는 정부에 첨단 AI가 제기하는 위험에 대한 과학적 이해를 제공하는 것입니다. AISI는 첨단 AI의 역량과 영향을 이해하고, 완화 방안을 개발하고 테스트하며, 정책에 정보를 제공하기 위한 연구와 인프라 구축을 수행합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 HuggingFace Blog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기