Loop the Loopies!
요약
새로운 루프형 트랜스포머 모델인 Loopie 시리즈를 소개합니다. MoE 구조를 활용하여 동일 연산 예산 대비 기존 바닐라 트랜스포머보다 뛰어난 성능을 입증했습니다.
핵심 포인트
- 20B 및 6B 규모의 두 가지 MoE 모델 구성
- 루프형 트랜스포머의 연산 효율성 문제 해결
- 새로운 사후 학습 파이프라인을 통한 추론 능력 강화
- IMO 및 IPhO에서 금메달 수준의 성능 달성
우리는 현재까지 가장 강력한 루프형 트랜스포머 (looped Transformer)인 Loopie를 선보입니다. Loopie 시리즈는 두 가지 전문가 혼합 (Mixture-of-Experts, MoE) 모델로 구성됩니다: 20B 파라미터 모델(활성 파라미터 2B)과 6B 파라미터 모델(활성 파라미터 0.6B)입니다. 루프형 트랜스포머 (Looped Transformers)는 오랫동안 과제에 직면해 왔습니다: 사전 학습 (pre-training) 연산량이 N배 증가할 때, 파라미터 수를 N배로 늘리는 것이 모델을 N번 루핑 (looping)하는 것보다 일반적으로 더 나은 성능을 보인다는 점입니다. Loopie는 이 문제를 해결합니다. 바닐라 (vanilla) 30B-A3B 모델과의 비교를 포함한 광범위한 어블레이션 연구 (ablation studies) 결과, Loopie는 동일한 연산 예산 (compute budget)으로 학습된 바닐라 트랜스포머 (vanilla Transformer) 베이스라인보다 실질적으로 뛰어난 성능을 보여줍니다. 우리의 새로운 사후 학습 (post-training) 파이프라인은 Loopie에 강력한 추론 (reasoning) 능력을 부여합니다. 2025 IMO 및 IPhO에서 Loopie는 도구 없이도 금메달 수준의 성능을 달성했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기