언어를 학습하는 방법을 배우기: 합성 비언어적 사전 지식 기반의 인컨텍스트 언어학습
요약
본 논문은 머신러닝 모델이 훈련 시 보지 못한 새로운 데이터(인컨텍스트)로부터 학습하는 능력을 향상시키는 방법을 제시합니다. 연구진은 자연어에 대한 사전 지식으로 순환적 인과 모델에서 생성된 합성 시퀀스를 사용해 트랜스포머를 훈련시켰습니다. 이 모델은 실제 언어를 예측하는 방법 자체를 학습하여, 접한 데이터가 늘어날수록 성능이 개선됨을 입증했습니다.
핵심 포인트
- 합성 비언어적 사전 지식으로 인컨텍스트 언어 학습 가능성을 증명함.
- 순환적 인과 모델 기반의 합성 시퀀스를 활용해 트랜스포머를 훈련시킴.
- 실제 언어 예측 능력 개선이 테스트 데이터 양에 따라 점진적으로 나타남.
- 언어 외에도 세기, 숫자 비교 등 다양한 결정론적 패턴 학습 가능.
인간에게는 데이터를 관찰하면서 학습하는 것이 쉽지만, 대부분의 머신러닝 모델은 훈련 중에 보지 못한 새로운 데이터로부터 학습하는 능력이 제한적입니다. 사전에 적합된 네트워크(TabPFN의 아이디어)는 합성 데이터로만 훈련된 모델이 완전히 인컨텍스트 방식으로 실제 테이블형 데이터로부터 학습할 수 있음을 보여주었습니다. 저희는 이 아이디어를 자연어와 같은 구조화된 시퀀스로 확장한 논문 "Learning to Learn a Language"를 공유하고자 합니다. 저희는 언어에 대한 사전 지식(prior)을 제안합니다: 모든 훈련 시퀀스는 무작위로 샘플링된 순환적 인과 모델(recurrent causal model)에서 나오므로, 각각은 새로운 합성 '언어'입니다. 오직 이러한 합성 시퀀스만으로 훈련된 3억 개 파라미터의 바이트 레벨 트랜스포머는 인컨텍스트 방식으로 실제 언어를 예측하는 방법을 학습합니다. 가중치가 고정된 위키피디아 텍스트를 가지고 테스트했을 때, 저희가 테스트한 여섯 가지 언어(영어, 중국어, 힌디어, 아랍어, 일본어, 한국어) 모두에서 더 많이 읽을수록 다음 바이트 예측이 개선되어, 바이트당 8비트에서 백만 바이트 이후에는 0.9–2.4까지 떨어집니다. 동일한 모델은 또한 인컨텍스트 방식으로 세기, 숫자 비교하기, 대략적인 덧셈, 그리고 소수나 Kolakoski 시퀀스와 같은 결정론적 시퀀스를 예측하는 법도 학습합니다. 물론 이는 수조 개의 토큰으로 훈련된 고전 언어 모델보다 텍스트에서 훨씬 못하지만, 저희 모델은 테스트 시점에 최대 백만 바이트의 언어만을 접한다는 점을 고려하면 그렇습니다. 저희가 흥미롭게 발견한 것은 인컨텍스트 방식으로 언어를 학습하는 능력이 합성 비언어적 사전 지식으로부터 나올 수 있다는 것입니다. 논문: https://arxiv.org/abs/2610.05879 코드: https://github.com/cbl/prior-fitted-language-model 가중치: https://huggingface.co/lennartcb/pflm1 /u/cbl007 제출 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/MachineLearning (hot)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기