추론 LLM에서의 테스트 시간 스케일링 (Test-Time Scaling): 추론 체제, 평가 및 재현성
요약
LLM의 추론 시간 연산(inference-time compute)을 활용한 테스트 시간 스케일링의 다양한 알고리즘과 체계적인 프레임워크를 제안합니다. 세 가지 구조적 체제와 평가 원칙, 재현성 요구 사항을 정의하며 대규모 추론 흔적 데이터를 공개합니다.
핵심 포인트
- 테스트 시간 스케일링의 세 가지 구조적 체제(단일 궤적, 리프 레벨, 접두사 레벨) 정의
- 엔드 투 엔드 시스템 성능과 후보군 진단을 분리하는 새로운 평가 원칙 개발
- 정확한 재현과 분포적 재현성을 구분하는 재현성 요구 사항 명시
- 20억 개 이상의 전체 추론 흔적(reasoning traces) 데이터셋 수집 및 공개
대규모 언어 모델 (Large language models)은 더 많은 추론 시간 연산 (inference-time compute)을 통해 실질적으로 더 어려운 추론 문제를 해결할 수 있습니다. 그러나 "테스트 시간 스케일링 (test-time scaling)"이라는 용어는 이제 단일 궤적 (single trajectory)을 따라 숙고를 확장하거나, 완성된 후보군을 샘플링하여 투표 또는 검증을 통해 집계하거나, 미완성된 부분 상태 (partial states)에 대해 탐색하는 등 다양한 추론 알고리즘을 포괄합니다. 이러한 알고리즘들은 통계적 구조, 연산 회계 (compute accounting), 그리고 실패 모드 (failure modes) 측면에서 서로 다릅니다. 이러한 절차들을 단일 스칼라 "예산 (budget)" 하에서 상호 교환 가능한 것으로 취급하거나, 이를 생성한 추론 프로토콜 (inference protocol) 없이 정확도만을 보고하는 것은 연구 간의 결과 비교를 어렵게 만듭니다.
우리는 세 가지 축을 따라 테스트 시간 스케일링에 대한 체계적인 설명을 개발합니다. 첫째, 우리는 테스트 시간 스케일링을 자기회귀 모델 (autoregressive model)의 암시적 접두사 트리 (implicit prefix tree) 상에서의 예산 기반 추론 (budgeted inference)으로 공식화하고, 세 가지 구조적 체제 (regimes)를 구분합니다: 단일 궤적 순차적 스케일링 (single-trajectory sequential scaling), 최종 결과 축소(terminal reduction)를 포함한 리프 레벨 스케일링 (leaf-level scaling), 그리고 접두사 레벨 스케일링 (prefix-level scaling). 둘째, 우리는 평가 대상을 전체 추론 시스템으로 취급하며, 엔드 투 엔드 (end-to-end) 시스템 성능과 후보군 진단 (candidate-bank diagnostics)을 분리하는 평가 원칙을 개발합니다. 우리는 좌표와 단순 함수를 통해 일반적인 반복 샘플링 (repeated-sampling) 지표를 복구하거나 제한할 수 있는 평가 프로필 (evaluation profile)을 도입하고, 연산량 및 불확실성 (uncertainty)에 대해 프로토콜에 맞춘 보고를 규정합니다. 셋째, 우리는 추론 프로토콜에 대한 재현성 요구 사항을 명시하며, 정확한 재현 (exact replay)과 분포적 재현성 (distributional reproducibility)을 구분하고 각각을 지원하는 데 필요한 아티팩트 (artifacts)를 식별합니다. 또한 우리는 모델 측면 및 인터페이스 메커니즘에 따라 오픈 웨이트 (open-weight) 추론 생태계를 정리하고, 이러한 원칙을 광범위한 지식, 기호 추론 (symbolic-reasoning), 경시 수학 (competition-mathematics) 벤치마크에 적용하며, 점진적으로 더 풍부한 검증기 (verifier) 및 토큰 레벨 신호가 포함된 20억 개 이상의 전체 추론 흔적 (reasoning traces)을 수집하여 공개합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기