언어에 앞선 논리: 형식적 유도(Formal Derivations)를 통한 사전-사전 학습(Pre-pretraining)이 기술 습득 및
요약
언어 모델의 자연어 습득을 가속화하기 위해 형식적 유도를 활용한 'Logic-PPT' 사전-사전 학습 전략을 제안합니다. 100B 토큰 규모의 실험 결과, 표준 방식보다 훨씬 적은 토큰으로 높은 정확도를 달성하며 기술 습득을 가속화함을 입증했습니다.
핵심 포인트
- 형식적 유도를 통해 풍부한 구조적·언어적 편향을 모델에 부여
- 표준 방식 대비 36B 적은 토큰으로 80% 정확도 달성
- 모델의 내부 기하학적 구조 재구성을 통한 표현력 향상
- 모델 압축성을 높여 33% 희소성에서도 밀집 모델 성능 유지
언어 모델(LM)을 기호 데이터(symbolic data)로 사전-사전 학습(Pre-pretraining)하는 것은 자연어 습득을 가속화하고 개선할 수 있습니다. 그러나 Dyck 언어나 절차적 알고리즘(procedural algorithms)과 같은 기존의 사전-사전 학습 태스크는 자연어의 표현 능력을 포착하지 못하는 좁은 프리미티브(primitives)에 의존합니다. 더욱이, 이전 연구들은 상대적으로 작은 토큰 예산에 국한되어 있어, 기술의 출현(skill emergence)과 표현 역학(representational dynamics)에 대한 통찰이 제한적이었습니다. 이러한 한계를 해결하기 위해, 우리는 형식적 유도(formal derivations)를 활용하여 더 풍부한 구조적 및 언어적 편향(biases)을 부여하는 원칙적인 초기화 전략으로서 논리 사전-사전 학습(Logic-PPT)을 제안합니다. 형식적 유도는 변수를 결합하고, 한정사(quantifiers)와 관계적 의존성(relational dependencies)을 연결하며, 긴 문맥(long contexts)에 걸쳐 술어-인자 구조(predicate-argument structures)를 구성하는 등 자연어의 핵심인 추상적 메커니즘을 요구합니다. 우리의 평가를 100B 토큰 규모로 확장했을 때, 논리 사전-사전 학습은 언어 모델의 기술 습득을 실질적으로 가속화하여, 표준 초기화 방식보다 36B 적은 토큰으로 언어 태스크에서 80%의 정확도를 달성하였으며, 다른 사전-사전 학습 베이스라인들을 능가했습니다. 메커니즘 측면에서, 형식적 유도는 저계수(lower-rank) 및 스펙트럼 집중(spectrally concentrated) 표현 공간으로 특징지어지는 지속적인 구조적 재구성(structural reorganization)을 유도합니다. 결정적으로, 우리는 이러한 내부 기하학(internal geometry)이 가지치기(pruning)를 통한 모델 압축성(compressibility) 향상을 가능하게 하여, 약 33%의 희소성(sparsity)에서도 밀집(dense) 베이스라인 성능과 일치함을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기