루프형 트랜스포머와 Mixture-of-Experts (MoE)를 위한 스케일링 법칙
요약
본 연구는 루프형 트랜스포머와 Mixture-of-Experts (MoE)의 효율적인 확장을 위한 새로운 'Loop Scaling Laws'를 제안합니다. 이 법칙은 순환 구조(recurrence)와 희소성(sparsity)을 모델 크기, 데이터와 함께 공동으로 모델링하여 성능 예측의 정확도를 높였습니다. 이를 통해 컴퓨팅 및 메모리 제약 조건 하에서 루프형 MoE 모델 설계의 이론적 기반을 마련했습니다.
핵심 포인트
- Loop Scaling Laws는 순환 구조와 희소성을 공동으로 모델링합니다.
- 루프형 MoE는 비루프형 대비 추론 효율성(활성화 파라미터) 및 총 파라미터 측면에서 이점을 가집니다.
- 이 법칙들은 표준 밀집/MoE 스케일링 법칙을 특수한 경우로 포함하며 예측 정확도가 높습니다.
루프형 트랜스포머(Looped transformers)와 Mixture-of-Experts (MoE)는 효율적인 확장을 위한 상호 보완적인 경로를 제공합니다. 순환 구조(recurrence)는 고정된 파라미터에서 계산 깊이를 증가시키고, MoE의 희소성(sparsity)은 고정된 활성화 컴퓨팅(active compute)에서 전체 용량을 확장합니다. 그러나 기존 스케일링 법칙들은 이러한 순환 또는 희소성 중 하나만을 개별적으로 모델링했습니다. 본 연구에서는 루프형 트랜스포머와 MoE의 순환 구조 및 희소성을 모델 크기, 데이터와 함께 공동으로 모델링하는 최초의 스케일링 법칙인 Loop Scaling Laws를 소개합니다. 이 법칙의 핵심은 바운디드하고 희소성 조건부적인 순환 매핑(sparsity-conditional recurrence mapping)이며, 이는 루프잉을 통한 유효 파라미터 이득과 희소성이 이 이득을 어떻게 높이는지를 특성화합니다. 이 법칙들은 루프형 모델의 홀드아웃 손실(held-out loss)을 이전 대안들보다 더 정확하게 예측하며, 표준 밀집(dense) 및 MoE 스케일링 법칙들을 특별한 경우로 복원합니다. 예측을 넘어, 적합된 법칙들은 컴퓨팅 및 메모리 제약 조건 하에서 루프형 MoE 모델을 설계하기 위한 원칙적인 기반을 제공합니다. 다운스트림 평가를 통해 두 축의 상호 보완적인 이점을 추가로 입증했습니다: 희소성은 추론(reasoning)에서 약 3배의 활성화 파라미터 효율성을 제공하고, 순환 구조는 총 파라미터 측면에서 약 2배의 효율성을 제공하며, 공동 스케일링은 성능 경계를 더욱 발전시킵니다. 실제적인 확장으로, 우리는 이러한 이득이 일조 토큰(trillion-token) 규모에서도 유지됨을 보여줍니다: 동일한 학습 컴퓨팅 조건에서, 법칙으로 도출된 순환 구조를 가진 루프형 MoE는 추론 벤치마크에서 비루프형 MoE보다 약 2배 더 큰 모델과 일치하며, 동시에 순환 구조를 통해 테스트 시간 스케일링을 가능하게 합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기