GradCuit: 신용 할당 경사 흐름(Credit-Assigned Gradient Flow)을 통한 견고하고 해석 가능한 테스트 시간 잠재
요약
GradCuit은 테스트 시간 최적화(test-time optimization)를 통해 LLM의 추론 능력을 개선하는 새로운 방법론을 제안합니다. Transformer 레이어에 최적화 가능한 잠재 상태를 삽입하여 보상 가중 경사를 직접 할당함으로써, 기존 CoT 방식보다 높은 정확도와 견고성, 해석 가능성을 제공합니다.
핵심 포인트
- 잠재 상태에 직접적인 신용 할당을 통한 테스트 시간 스케일링 구현
- CoT 프롬프팅 대비 평균 6.6%p 높은 정확도 달성
- 학습률 변화에도 일관된 성능을 보이는 높은 견고성 확보
- 토큰 수준의 경사 분석을 통한 추론 과정의 해석 가능성 증명
최적화 기반 잠재 추론(Optimization-based latent reasoning)은 모델 파라미터를 고정(frozen)한 상태에서 테스트 시간(test time)에 인스턴스별 연속 상태(continuous states)를 최적화함으로써 대규모 언어 모델(Large Language Model, LLM)의 출력을 개선합니다. 그러나 기존 방법들은 일반적으로 이러한 상태를 디코딩된 토큰(decoded tokens)을 통해 추론 궤적(reasoning trajectory)에 연결하므로, 시퀀스 수준의 신용 할당(credit assignment)이 간접적이며 잠재 업데이트(latent updates)가 이후의 추론을 어떻게 형성하는지 불분명하게 만듭니다. 우리는 프롬프트의 은닉 표현(hidden representations)과 생성된 연속 내용(generated continuation) 사이의 선택된 Transformer 레이어에 최적화 가능한 잠재 상태(latent states)를 삽입하는 GradCuit (gradient through circuit)을 소개합니다. 인과적 셀프 어텐션(Causal self-attention)은 모든 연속 토큰의 로그 확률(log-probability)이 나머지 Transformer 블록들을 통해 이전의 모든 잠재 상태로 향하는 미분 가능한 경로를 제공하도록 하여, 전체 연속 내용으로부터의 보상 가중 경사(reward-weighted gradients)가 잠재 상태에 직접 할당될 수 있게 합니다. 5개의 지시어 미세 조정(instruction-tuned) 백본, 3개의 추론 벤치마크, 2개의 답변 형식을 대상으로 한 실험에서 GradCuit은 평균 64.5%의 정확도를 달성하였으며, 이는 생각의 사슬(Chain-of-Thought, CoT) 프롬프팅보다 6.6%포인트, 가장 강력한 경쟁 방법보다 2.4%포인트 높은 성능입니다. GradCuit은 또한 더 높은 견고성(robustness)을 보여줍니다. 7가지 학습률(learning-rate) 설정 전반에 걸쳐 일관되게 LatentSeek보다 우수한 성능을 보였으며, 정확도의 표준 편차를 1.53에서 0.82로 줄였고, 심지어 무작위 보행(random-walk) 변형조차 LatentSeek과 경쟁할 만한 수준을 유지했습니다. 해석 가능성(interpretability) 측면에서, 토큰 수준의 경사 기여도(gradient attribution) 분석은 잠재적 영향력이 추론 연결 토큰(reasoning-connector tokens)에 집중됨을 보여주며, 레이어 분석을 통해 초기에서 중간 단계의 Transformer 레이어가 가장 효과적인 최적화 공간임을 확인했습니다. 결과 피드백으로부터 내부 추론을 직접 최적화함으로써, GradCuit은 LLM이 단순히 출력을 재생성, 샘플링 또는 재순위화(rerank)하는 것이 아니라 추론 방식을 적응시키는, 견고하고 해석 가능한 테스트 시간 스케일링(test-time scaling)의 새로운 축을 엽니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기