효율적 추론에서 토큰 값 불평등성에 관하여
요약
본 논문은 CoT 추론 시퀀스 내 토큰의 가치가 균일하지 않음을 발견했습니다. 핵심적인 구조적 내용을 담는 '핵심 토큰'과 기여도가 낮은 '중복 토큰(filler)'을 구분하는 TokenProbe 프레임워크를 제시합니다. 이를 통해 토큰 사용량을 크게 줄이면서도 추론 품질을 유지할 수 있습니다.
핵심 포인트
- CoT 추론의 높은 비용 문제를 해결하기 위해 토큰 가치 불평등성을 진단했습니다.
- TokenProbe는 핵심 토큰과 기여도가 낮은 중복 토큰을 구분하는 프레임워크입니다.
- 이 방법은 토큰 사용량을 76% 줄이면서 추론 품질을 유지할 수 있습니다.
- Gemini-3.1-Pro 같은 플래그십 모델 대비 우수한 효율성을 보여줍니다.
Chain-of-Thought (CoT) 추론은 대규모 언어 모델(LLM)이 복잡한 작업에서 상당한 성능 향상을 달성할 수 있게 했습니다. 하지만 이러한 성능 향상은 극적으로 증가된 토큰 소비라는 비용을 초래합니다. 이는 근본적인 질문을 제기합니다: 추론 과정의 모든 토큰이 동등하게 가치가 있는가? 우리는 핵심적인 경험적 발견에 기반하여 진단 및 최적화 프레임워크를 제시합니다: CoT 추론 시퀀스 내 토큰의 값은 매우 비균일하며, 이러한 비균일성은 토큰 수준 로그 확률 신호로 효과적으로 특징지을 수 있습니다. 우리는 정규화된 로그 확률이 구조적이고 결정적인 추론 내용을 담고 있는 핵심 토큰과, 탐색적이고 낮은 확신도의 채움(filler) 역할을 하여 최종 답변에 직접적으로 기여하는 바가 적은 중복 토큰을 구별하는 데 도움이 된다는 것을 보여줍니다. 이러한 발견들을 바탕으로, 우리는 두 가지 경험적 발견과 하나의 주장을 중심으로 TokenProbe 프레임워크를 공식화합니다: 이 발견들은 먼저 토큰 값의 불평등성을 식별하고, 이후 핵심 토큰 대리 지표(proxy)로서 TokenProbe를 확립하며, 이 주장은 중복 토큰을 선택적으로 압축하는 것이 정확도-토큰 효율성 공간에서 파레토 개선(Pareto improvements)을 가져올 수 있다는 GRPO 목적 함수를 제시합니다. 경험적으로, 우리의 방법은 토큰 사용량을 기준선 대비 76% 줄이면서 추론 품질을 유지합니다. 일치된 추론 길이 예산 하에서도, Gemini-3.1-Pro와 같은 강력한 플래그십 기준 모델보다 우수할 수 있음을 보여줍니다. 홈페이지: https://runjia.tech/tokenprobe/.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기