GIM: 여러 인지 영역을 통합하는 과제를 통한 모델 평가
요약
GIM(Grounded Integration Measure)은 지식 암기와 추론을 분리하지 않고, 광범위한 지식 위에서 여러 인지 연산을 통합적으로 수행해야 하는 820개의 독창적인 문제를 제공하는 새로운 벤치마크입니다. 이 벤치마크는 IRT(Item Response Theory) 모델을 사용하여 모델의 능력을 정밀하게 추정하며, 테스트 시간 연산(test-time compute)과 모델 성능 간의 트레이드오프를 분석합니다.
핵심 포인트
- 기존 벤치마크의 한계인 지식 암기 의존성 및 추론의 맥락 결여 문제를 해결하기 위해 통합적 인지 영역 평가를 지향함
- 제약 조건 만족, 상태 추적, 인식적 경계 등 다양한 인지 연산을 요구하는 전문가 작성 문제로 구성됨
- IRT(문항 반응 이론) 모델을 도입하여 데이터 왜곡 상황에서도 모델의 능력을 정확하게 정렬하고 추정함
- 테스트 시간 연산(test-time compute)과 양자화(quantization)가 모델 성능에 미치는 영향을 광범위하게 조사함
LLM (Large Language Model) 벤치마크가 포화됨에 따라, 평가 커뮤니티는 난이도를 높이기 위해 두 가지 전략을 추구해 왔습니다. 지식 요구 사항을 높이거나 (GPQA, HLE), 추상적 추론 (ARC-AGI)을 위해 지식을 완전히 제거하는 것입니다. 첫 번째 방식은 암기와 능력을 혼동하며, 두 번째 방식은 추론을 그것이 중요한 실제 맥락으로부터 분리합니다. 우리는 다른 접근 방식을 취합니다. Grounded Integration Measure (GIM)은 통합을 통해 난이도가 발생하는 820개의 독창적인 문제(공개 615개, 비공개 205개)로 구성된 벤치마크입니다. 개별 문제는 광범위하게 접근 가능한 지식 위에서 여러 인지 연산(제약 조건 만족 (constraint satisfaction), 상태 추적 (state tracking), 인식적 경계 (epistemic vigilance), 청중 교정 (audience calibration))을 조정할 것을 요구하므로, 추론이 전문 지식에 의해 제한되지 않으면서도 현실적인 과제에 근거를 두도록 합니다. 각 문제는 전문가가 직접 작성한 독창적인 구성물이며, 대다수는 루브릭으로 분해된 채점 방식(중앙값 6개의 독립적으로 판단된 기준)을 따릅니다. 균형 잡힌 공개-비공개 분할은 내장된 오염 진단 기능을 제공합니다. 우리는 28개 모델에 걸친 20만 개 이상의 프롬프트-응답 쌍에 대해 연속 응답 2-매개변수 로지스틱 (2PL) IRT (Item Response Theory) 모델을 교정하여, 원시 정확도가 오류나 누락된 데이터로 인해 왜곡될 때도 테스트 구성의 순서를 올바르게 정렬하는 강력한 능력 추정치를 생성함으로써 벤치마크 보고의 일반적인 과제를 해결합니다. 이 프레임워크를 사용하여, 우리는 22개 모델과 47개 테스트 구성(고유 모델, 사고 수준 쌍)을 아우르는 포괄적인 리더보드를 제시하며, 우리가 아는 한 고정된 벤치마크에서 테스트 시간 연산 (test-time compute)이 모델 능력과 어떻게 트레이드오프(trade-off)되는지에 대한 가장 광범위하게 발표된 연구를 수행합니다: 11개 모델을 35개 테스트 구성에 걸쳐 조사하였습니다. 우리는 사고 예산 (thinking budget) 및 양자화 (quantization)와 같은 동일 계열 내의 구성 선택이 모델 선택만큼 중요하다는 것을 관찰했습니다. 우리는 평가 프레임워크, 교정된 IRT 매개변수 및 모든 공개 문제를 공개합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기