TasteVal: AI 시스템의 실험 연구 역량 측정
요약
TasteVal은 AI 시스템의 '연구 역량(research taste)'을 측정하는 새로운 벤치마크입니다. 이는 모델이 주어진 문제에 대해 반복적으로 실험을 설계하고 결과를 해석하는 능력을 평가하며, 특히 컴퓨팅 효율성을 핵심 요소로 작동화했습니다. 최첨단 모델 Opus 5.5는 전문가 기준선을 초과했으며, 컴퓨팅 승수는 2.3배를 기록하여 높은 효율성을 입증했습니다.
핵심 포인트
- 연구 역량은 문제 선택, 실험 설계, 결과 해석 능력을 포함합니다.
- TasteVal은 반복적인 실험 설계를 통해 모델의 연구적 추론 능력을 측정합니다.
- 최첨단 모델 Opus 5.5는 전문가 기준선보다 높은 컴퓨팅 효율성을 보였습니다.
- AI 모델의 컴퓨팅 승수는 지속적으로 개선되는 추세입니다.
우리는 최첨단 모델의 실험 연구 역량을 평가하기 위한 벤치마크인 TasteVal을 소개합니다. 우리는 연구 역량(research taste)을 흥미로운 문제를 선택하고, 실험을 설계하며, 실험 결과를 해석하는 능력으로 정의합니다. TasteVal은 연구 역량 중 실험적 구성 요소를 측정합니다. 즉, 주어진 고정된 연구 문제에 대해 모델이 얼마나 잘 반복적으로 실험을 설계하고 그 결과로부터 결론을 도출하는지를 측정합니다. 우리는 실험적 연구 역량을 컴퓨팅 효율성(compute efficiency)으로 작동화했습니다. 전문가 인간과 동일한 점수를 얻는 데 절반의 순차적 실험 컴퓨팅만 사용하는 연구자는 두 배의 실험적 역량을 갖습니다. 따라서 실험적 역량은 실험 컴퓨팅에 대한 승수 역할을 하며, AI 발전 예측의 핵심 입력 요소가 됩니다. TasteVal은 최첨단 AI R&D를 대표하는 8가지 새롭고 도전적이며 개방형 과제로 구성되어 있습니다. 역량(taste)을 코딩 능력과 분리하기 위해, 평가 대상 모델은 연구자(Researcher) 역할을 수행하며 반복적으로 실험을 설계하고, 고정된 Coder 에이전트가 이를 구현하고 결과를 보고합니다. 연구자는 40 H100 시간 또는 120 벽시계 시간 예산 중 먼저 소진될 때까지 실행됩니다. 우리는 과제당 최소 2명씩 총 24명의 인간 전문가를 모집하여, 과제별 최고 전문가 시도를 전문가 기준선(expert baseline)으로 사용했습니다. 우리는 2023년부터 2026년 사이에 출시된 20개 모델을 평가했습니다. 가장 성능이 좋은 모델인 Opus 5.5는 우리의 전문가 기준선을 초과했으며, 컴퓨팅 승수는 2.3배 (95% CI 1.15-4.37)였고, 이는 기준선 평균 실행당 비용의 약 1/30 수준이었습니다. TasteVal에서 최첨단 모델의 컴퓨팅 승수는 2025년 12월부터 약 3.0개월마다 두 배가 되었으며 (95% CI 1.7-5.0), 이는 2023년부터 2025년 12월까지의 14개월 간격에서 나타났던 추세보다 개선되었습니다. 최종 정규화된 성능으로 측정했을 때, 최첨단 모델은 트렌드 브레이크를 보이지 않고 14.6개월마다 두 배가 되었습니다. TasteVal이 오염되지 않도록, 우리는 과제를 공개하지 않습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기