망원경식 언어 모델 (Telescopic Language Models)
요약
망원경식 언어 모델(TLM)은 여러 컴퓨팅 예산에 맞춰 연속적인 성능을 제공하는 중첩된 용량 트랜스포머입니다. 이 모델은 전체 앵커를 가진 확률적 접두사 감독 하에 학습되어, 모든 깊이에서 유효한 언어 모델 아티팩트를 생성합니다. TLM은 기존 고정 출구 제품군 대비 품질-예산 곡선 아래 면적을 크게 줄이고 GPU 비용도 절감하는 효율성을 입증했습니다.
핵심 포인트
- TLM은 연속적인 성능 제공으로 다양한 컴퓨팅 예산에 대응 가능합니다.
- 학습된 아티팩트는 모든 깊이에서 유효한 언어 모델로 활용됩니다.
- 기존 고정 출구 제품군 대비 비용-성능 효율성이 크게 향상되었습니다.
- 모델의 탄력성은 중첩 구조 자체보다 훈련 목표 설정에 달려있습니다.
배포되는 언어 모델은 종종 여러 컴퓨팅 예산을 충족해야 하지만, 각 예산에 맞춰 서비스를 제공하는 것은 여전히 지점마다 별도의 훈련 또는 압축 실행을 의미합니다. 우리는 이러한 연속체 역할을 하는 망원경식 언어 모델(Telescopic Language Model, TLM)을 학습시켰습니다. 이는 전체 앵커를 가진 확률적 접두사 감독 하에 중첩된 용량 트랜스포머입니다. 매 단계마다, 용량 축의 무작위로 잘린 접두사가 전체 다음 토큰 목표와 함께 하나의 전체 용량 패스와 함께 훈련됩니다. 따라서 학습된 아티팩트는 모든 깊이에서 유효한 언어 모델이 됩니다. 단계당 두 번의 순전파-역방향 전파가 필요하며, 구조적 변경이나 추론 시 추가적인 것은 없습니다. Matryoshka Language Model Suites (MLMS)와 같은 고정 출구(fixed-exit) 제품군은 이 설계 공간의 한 지점을 차지하며, 그 지점에는 비용이 따릅니다. 몇 개의 고정 출구만 감독하는 것은 중첩된 모델을 다른 모든 곳에서 우연 수준에 머물게 합니다(기본값에서 퍼플렉시티 10^2-10^5). 2억 개 규모의 프록시 제품군(20B FineWeb-Edu 토큰, 모든 방법에 동일한 데이터 스트림)에서 단일 TLM 실행은 그 스무 개의 레이어 접두사 각각에서 유효한 언어 모델이며, 퍼플렉시티와 퍼플렉시티에 민감한 다운스트림 작업 모두에서 성능을 보였습니다. 이는 고정 출구 제품군 대비 품질-예산 곡선 아래 면적을 43-44% 감소시키면서도 전체 용량에서는 이를 일치하는 수준으로 달성했으며, 실행당 GPU 비용은 약 12% 낮았습니다. 접두사 샘플링 밀도는 조절 가능한 다이얼입니다: 몇몇 깊이에 집중하면 그곳에서 고정 출구의 품질을 회복하지만 연속성을 희생해야 하므로, 작동 지점은 아키텍처적 선택이라기보다는 훈련 시점의 선택이 됩니다. 이러한 결과는 모델 자체의 중첩(nesting)이 아니라 훈련 목표가 모델을 탄력적으로 만드는 요소임을 시사합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기