[논문] WaveFront Decoding: 루프형 언어 모델을 위한 병렬화된 자체 추측 디코딩
요약
본 논문은 루프형 언어 모델의 디코딩 지연 시간 문제를 해결하기 위해 Wavefront Decoding (WFD) 프레임워크를 제안합니다. WFD는 가중치 공유 아키텍처의 특성을 활용하여 초안 작성과 완전 깊이 검증을 하나의 재귀 호출 내에서 병렬적으로 처리합니다. 이를 통해 기존 방식 대비 높은 속도 향상을 달성했습니다.
핵심 포인트
- WFD는 루프형 모델의 디코딩 지연 시간을 개선하는 훈련 불필요 프레임워크입니다.
- 초안 작성과 검증을 동일 재귀 호출 내에서 병렬로 처리하여 효율성을 높였습니다.
- Ouro-2.6B 및 Huginn-3.5B 등에서 자가회귀 방식 대비 높은 속도 향상을 입증했습니다.
루프형 언어 모델(looped language models)은 파라미터 수를 늘리지 않으면서 유효 깊이(effective depth)를 증가시키기 위해 가중치 공유 블록(weight-shared block)을 반복적으로 적용합니다. 그러나 이로 인해 생성된 토큰당 T개의 순차적 재귀 블록 호출(sequential recurrent-block calls)이 발생하며, 이는 디코딩 지연 시간(decoding latency)을 크게 증가시킵니다. 이 문제를 해결하기 위해, 우리는 루프형 언어 모델을 위해 설계된 훈련 불필요(training-free) 자체 추측 디코딩 프레임워크인 Wavefront Decoding (WFD)을 소개합니다. WFD는 이러한 아키텍처의 두 가지 속성을 활용합니다: 중간 재귀 출력(intermediate recurrence outputs)이 효과적인 초안 예측(draft predictions)을 제공하고, 가중치 공유가 서로 다른 위치와 재귀 깊이에서의 토큰 상태를 하나의 배치된 재귀 블록 호출로 처리할 수 있게 합니다. WFD는 이러한 혼합 깊이 상태들을 대각선 전면파(diagonal wavefront)로 구성하여, 얕은 깊이에서 지속적으로 새로운 위치의 초안을 작성하는 동시에 이전 위치들을 완전한 깊이 검증(full-depth verification) 쪽으로 진행시킵니다. 따라서 위상 분리형(phase-separated) 초안-후-검증 스케줄과 달리, WFD는 동일한 재귀 호출 내에서 초안 작성과 검증을 병렬적으로 배치하며, 거부된 초안은 완전 깊이 예측을 사용하여 수정합니다. 6가지 Spec-Bench 태스크 카테고리 전반에 걸쳐, WFD는 Ouro-2.6B에서 자가회귀 디코딩(autoregressive decoding) 대비 2.42배, Huginn-3.5B에서 3.54배의 속도 향상을 달성하며, 일관되게 초안-후-검증 방식보다 우수합니다. 교차 재귀 KV 공유(Cross-recurrence KV sharing)는 전면파 KV 트래픽을 더욱 줄이고 WFD의 속도 향상을 Huginn-3.5B에서 4.81배까지 증가시킵니다. 코드는 이 https URL 에서 이용 가능하며, arXiv: https://arxiv.org/abs/2609.23033 PDF: https://arxiv.org/pdf/2609.23033 GitHub: https://github.com/summerbro-hhj/wavefront-decoding 입니다. /u/pmttyji가 r/LocalLLaMA에 제출했습니다. [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기