교사 감독을 이용한 잠재 정보 피드백 트랜스포머 사전 학습
요약
본 연구는 트랜스포머 언어 모델(LM)이 가진 정보 흐름 병목 현상을 해결하기 위해 LIFT(Latent Information Feedback Transformer) 아키텍처를 제안합니다. LIFT는 사전 학습 과정에서 깊은 레이어의 상태 정보를 얕은 레이어로 피드백하여, LM이 생성 전반에 걸쳐 상태를 효과적으로 전파할 수 있도록 합니다. 실험 결과, LIFT는 다양한 언어 모델링 및 다운스트림 작업에서 기존 트랜스포머 대비 우수한 성능을 입증했습니다.
핵심 포인트
- LIFT는 사전 학습 중 정보 흐름 병목 현상을 해결하는 아키텍처입니다.
- 깊은 레이어의 상태 정보를 얕은 레이어로 피드백하여 모델 전반에 걸쳐 상태를 전파합니다.
- 다양한 언어 모델링 및 다운스트림 작업에서 기존 트랜스포머보다 우수한 성능을 보였습니다.
트랜스포머 언어 모델(LM)은 순방향식(feed-forward)입니다: 깊은 레이어의 표현이 얕은 레이어로 다시 전달되지 않으며, 생성 단계에 걸쳐 정보를 아래로 흐르게 하는 유일한 경로는 디코딩된 토큰뿐입니다. 이러한 협소한 채널은 모델이 중간 결과를 재계산하고 대안적인 연속성을 폐기하도록 강제합니다. 본 연구에서는 사전 학습 중 이 병목 현상을 제거하여 LIFT(Latent Information Feedback Transformer) 아키텍처와 훈련 방법을 도입했습니다. 이는 LM이 생성 전반에 걸쳐 상태를 전파할 수 있도록 합니다. 우리는 순환 상태 학습을 교사 주도 예측 문제로 변환함으로써 이를 달성합니다: 각 입력 토큰은 상용화된 사전 학습 LM의 다음 토큰 분포에서 파생된 정보 밀도가 높은 상태와 쌍을 이룹니다. 추가적인 적은 수의 매개변수로 확장된 모델은 다음 토큰과 다음 상태를 모두 예측하도록 훈련됩니다. 입력 상태가 미리 계산되므로, 사전 학습은 위치 전반에 걸쳐 완전히 병렬로 유지됩니다. 추론 시에는 모델 자체의 예측된 상태가 피드백되는데, 이는 모델 크기에 따라 감소하는 사소한 계산 오버헤드를 가집니다. 1억 3500만 개에서 10억 개의 매개변수에 이르는 사전 학습 모델을 사용한 실험 결과, LIFT는 토큰 일치 예산(token-matched budget) 하에서 언어 모델링, 다운스트림 추론 작업 및 절차적 작업에서 표준 트랜스포머와 기준 모델보다 지속적으로 우수한 성능을 보였으며, 계산 일치(compute-matched) 트랜스포머와는 동등하거나 그 이상의 성능을 보였습니다. 더욱이, 상태 추적 작업에 대한 통제된 연구를 통해 작은 LIFT가 해당 작업을 실패하는 트랜스포머의 상태로 훈련되었음에도 불구하고, 8배 더 많은 데이터로 훈련된 같은 크기의 트랜스포머보다 우수한 성능을 보이는 것을 보여주었습니다. 전반적으로, 우리는 LM이 확장 가능한 교사 감독을 통해 사전 학습 중 깊은 레이어에서 얕은 레이어로의 피드백을 활용하는 방법을 배울 수 있음을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기