Looped 모델을 올바르게 구현하기 위한 접근 방식 (Part II): 고정점 재고찰
요약
본 논문은 반복적인 언어 모델(looped LLM) 구현 시 발생하는 비용 문제를 해결하기 위한 접근 방식을 제시합니다. 고정점(fixed points)에 대한 재고찰을 통해 훈련, 디코딩, RL 등 여러 단계에서 효율성을 높이는 방법을 제안하며, 깊이 사전과 입력 주입이라는 두 가지 핵심 구성 요소를 개선했습니다.
핵심 포인트
- 고정점 근접 시 경로 중요도 감소로 비용 절감 가능
- 깊이 사전 및 직교 주입을 통해 모델 성능 향상
- KV 공유를 깨뜨리지 않으면서 효율적인 훈련 구현
- 학습된 사전과 직교 주입은 다양한 규모에서 우수한 퍼플렉서티 달성
반복적인(looped) 언어 모델의 모든 재구현은 훈련, 디코딩, 프리필(prefill), 그리고 강화학습(RL)에서 비용을 추가합니다. 반복 상태가 고정점(fixed points)에 가까워질수록, 그 지점으로 가는 경로의 중요성은 줄어듭니다. 이는 훈련 시 절단된 역전파(truncated backpropagation)를 가능하게 하고; 디코딩 시 거의 정확도 손실 없이 터미널 키-값(KV) 공유를 가능하게 하며; 프리필 속도가 최대 1.79배 빨라진 증류 학생 모델을 만들고; 재현된 궤적을 통해 역전파하는 것보다 2배 빠른, 저장된 롤아웃 상태에서 기울기를 계산하는 RL 업데이트를 가능하게 합니다. 따라서 우리는 이러한 고정점을 형성하는 훈련의 두 가지 구성 요소, 즉 깊이 사전(depth prior)과 입력 주입(input injection)을 개선합니다. 고정 깊이 훈련은 KV 공유를 깨뜨리고, Huginn의 광범위한 깊이 사전은 공유를 지원하지만 목표 깊이에서 필요한 것보다 더 많은 감독을 희석시킵니다. 우리는 예측 피드백으로부터 사전을 학습하며, 엔트로피 항을 통해 이를 넓게 유지합니다. 기존 주입 방식들은 상태의 입력 구성 요소가 주입을 증폭시키거나 상쇄하도록 허용했습니다. 우리는 직교(orthogonal) 주입을 통해 이 구성 요소를 제거합니다. 1억 개에서 16억 개의 매개변수로, 학습된 사전과 직교 주입은 각각 Huginn의 사전 및 기존 주입 방식에 비해 모든 규모에서 퍼플렉서티를 낮춥니다. 16억 개의 매개변수에서, 3배 작은 KV 캐시를 가진 학습된 사전은 전체 캐시를 사용한 고정 깊이 훈련의 다운스트림 평균과 일치합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG (Machine Learning)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기