
Python 및 Wikitext에 최적화된 18B 토큰 기반 700M 모델 사전 학습 완료 |
요약
Python docstring 데이터 50억 토큰을 사용하여 사전 학습된 700M 파라미터 규모의 모델을 소개합니다. 이 모델은 채팅용 미세 조정 없이 다음 토큰 예측을 목적으로 설계되었습니다.
핵심 포인트
- Python 및 Wikitext에 최적화된 700M 파라미터 모델
- 50억 개의 Python docstring 토큰을 활용한 지속적 사전 학습
- 채팅용 미세 조정이 없는 순수 다음 토큰 예측 모델
- 기존 GPT-2 대비 향상된 성능 제공
이 모델이 시중에 나온 수만 번째의 새로운 10억 미만 파라미터 (sub billion parameter) 모델이며, 아마도 Qwen 3 0.6B나 Qwen 3.5 0.8B만큼 뛰어나지는 않겠지만, 여전히 제법 괜찮은 성능을 보여줍니다. 저의 의도는 순수하게 doc string 기반의 Python 데이터로 약 50억 (5 Billion) 개의 토큰을 더 사용하여 이 모델을 지속적으로 사전 학습 (pre-train) 하는 것입니다. 이 모델은 채팅을 위해 미세 조정 (fine-tuned) 된 것이 아니라, 단순한 다음 토큰 예측 (next-token prediction) 모델입니다. 적어도 /u/TheOneWhoWil이 제출한 GPT-2보다는 확실히 한 차원 더 뛰어납니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기