[논문] DLoop: 루프형 추측 디코딩
요약
본 논문은 LLM의 생성 속도를 가속화하는 추측 디코딩(Speculative decoding) 기법을 개선한 DLoop를 제안합니다. 기존 방식의 비효율적인 목표 모델 순전파 문제를 해결하기 위해, DLoop는 검증 전에 여러 초안 단계를 적응적으로 수행하고 누적된 토큰을 한 번에 검증하는 루프형 방식을 사용합니다. 이를 통해 다양한 추측 디코딩 방법론 전반에서 손실 없는 방식으로 속도를 크게 향상시킵니다.
핵심 포인트
- DLoop는 루프형 추측 디코딩으로, 여러 초안 단계를 적응적으로 수행합니다.
- 검증 전에 초안을 누적하고 한 번에 검증하여 목표 모델 순전파 횟수를 줄입니다.
- 추가적인 초안 모델 순전파를 통해 목표 모델의 계산량을 절감합니다.
- EAGLE-3 등 다양한 방법론에서 최대 41%까지 속도 향상을 보여줍니다.
추측 디코딩(Speculative decoding)은 대규모 언어 모델(LLM)의 자기회귀적 생성(autoregressive generation) 속도를 가속화합니다. 각 초안 단계(drafting stage)에서 경량의 초안 모델(draft model)이 토큰을 제안하고, 목표 모델(target model)이 이를 검증합니다. 점점 더 능력이 향상되는 초안 모델로 인해, 목표 모델은 초안 단계에서 생성된 모든 토큰을 자주 수락하는 것을 발견했습니다. 그럼에도 불구하고, 초안 단계가 끝날 때마다 검증이 뒤따르기 때문에, 초안 생성이 계속될 수 있었음에도 불필요한 목표 모델 순전파(forward passes)가 발생합니다. 적응형 초안 길이 방법(Adaptive draft length methods)은 디코딩 중에 몇 개의 초안 토큰이 검증에 선행할지 결정하지만, 이는 자기회귀적 초안 모델에 대해서만 속도 향상을 높입니다. 병렬 초안 모델의 경우, 추가적인 초안 생성을 위해서는 아직 검증되지 않은 초안 토큰들의 목표 모델 은닉 상태(hidden states)가 필요합니다. 우리는 DLoop를 제안하는데, 이는 검증 전에 여러 개의 초안 단계를 적응적으로 수행하는 루프형 추측 디코딩 형태입니다. DLoop는 초안 모델이 신뢰성을 유지하는 동안 계속해서 초안을 생성하고, 누적된 모든 초안 토큰을 한 번에 검증합니다. 루프 인식 학습(Loop-aware training)은 초안 모델에게 검증되지 않은 초안 토큰들에 대한 자체 은닉 상태를 노출함으로써 추가적인 초안 단계에서 신뢰성을 유지하게 합니다. DLoop는 추가적인 초안 모델 순전파를 사용함으로써 검증에 필요한 목표 모델 순전파 횟수를 줄입니다. EAGLE-3, DFlash, Domino, DSpark 및 다중 토큰 예측 모듈을 포함한 다양한 추측 디코딩 방법 전반에 걸쳐, DLoop는 손실 없는(lossless) 디코딩을 유지하면서 벽시계 속도 향상을 5%에서 41%까지 개선합니다. 코드는 이 [URL] 에서 이용 가능할 예정입니다. 논문: https://arxiv.org/abs/2610.07659 PDF: https://arxiv.org/pdf/2610.07659 GitHub: https://github.com/naver-ai/DLoop 현재 코드는 내부 검토 중이며 곧 공개될 예정입니다. 기대해 주세요! /u/pmttyji 님이 제출했습니다. [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기