LLM 테스트 시간 스케일링(Test-Time Scaling)을 위한 해석 가능한 적응형 샘플링
요약
LLM의 추론 능력을 높이는 테스트 시간 스케일링 과정에서 프롬프트 복잡도와 모델 확신도를 기반으로 샘플링 예산을 동적으로 조절하는 적응형 방식을 제안합니다. 퍼지 컨트롤러를 통해 연산 효율성을 높이면서도 성능을 유지하는 해석 가능한 추론 메커니즘을 제시합니다.
핵심 포인트
- 프롬프트 복잡도와 모델 확신도에 따른 적응형 샘플링 제안
- 퍼지 컨트롤러를 활용하여 추론 시간 연산의 효율성 및 해석 가능성 확보
- 수학적 추론 및 질의응답 작업에서 기존 베이스라인 대비 성능 개선
- 평균 샘플 수를 줄이면서도 전체 예산 제어 방식에 근접한 성능 유지
테스트 시간 스케일링 (Test-time scaling)은 여러 개의 후보 답변을 생성하고 집계함으로써 LLM의 추론 능력을 향상시키지만, 많은 파이프라인이 쉬운 프롬프트와 어려운 프롬프트에 동일한 연산량을 소비하는 쿼리당 고정된 예산 (fixed per-query budgets)을 사용합니다. 이러한 고정된 예산은 특정 프롬프트가 왜 특정 수의 샘플을 할당받는지 설명하지 못하기 때문에 조사하기가 어렵습니다. 우리는 추정된 프롬프트 복잡도 (prompt complexity) 및 모델 확신도 (model confidence)를 포함한 해석 가능한 신호들을 쿼리당 샘플링 예산으로 매핑하는 경량 퍼지 컨트롤러 (fuzzy controller)를 이용한 적응형 테스트 시간 스케일링 (adaptive test-time scaling)을 제안합니다. 이 컨트롤러는 더 쉽거나 확신도가 높은 프롬프트에는 더 적은 샘플을 할당하고, 더 어렵거나 불확실한 프롬프트에는 더 많은 샘플을 할당하여, 추론 시간 연산 (inference-time compute)을 고정되거나 불투명한 방식이 아닌 조사 가능한 방식으로 만듭니다. 우리는 일치된 디코딩 설정 (matched decoding settings)과 제어된 답변 선택 (controlled answer selection)을 갖춘 공정 정렬 프로토콜 (fair-alignment protocol) 하에서 평가를 수행하였으며, 질의응답 (question-answering) 및 수학적 추론 (mathematical reasoning) 작업에서 best-of-$N$, 연산 인지 스케일링 (compute-aware scaling), 그리고 자기 확신 기반 (self-certainty-based) 베이스라인들과 비교하였습니다. 모델과 데이터셋 전반에 걸쳐, 적응형 퍼지 제어 (adaptive fuzzy control)는 여러 표준 베이스라인보다 성능을 개선하였으며, 평균 샘플 수를 줄이면서도 셀렉터 매칭 전체 예산 제어 (selector-matched full-budget control)에 근접한 성능을 유지했습니다. 이러한 결과는 해석 가능한 적응형 샘플링 (interpretable adaptive sampling)이 대규모 언어 모델 (large language models)에서 더 효율적인 테스트 시간 추론을 위한 실용적인 방향임을 시사합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기