BetterGPT-150M 출시 – 약 1.5억 개의 파라미터를 가진 컴팩트한 150M 파라미터 완성형 모델 (+ HF Space 라이브 데모)
요약
1.5억 개의 파라미터를 가진 컴팩트한 언어 모델 BetterGPT-150M이 출시되었습니다. 150억 개의 토큰으로 학습되었으며, GPT-2 Small보다 뛰어난 성능을 보이면서도 낮은 사양의 CPU나 엣지 디바이스에서 효율적으로 실행 가능합니다.
핵심 포인트
- 1.5억 파라미터 규모의 가볍고 효율적인 인과적 언어 모델
- GPT-2 Small 대비 우수한 성능 및 높은 토큰 효율성
- 낮은 RAM/vRAM 점유율로 표준 CPU 및 엣지 디바이스 최적화
- FineWeb-Edu, Starcode-python 등 고품질 데이터셋 활용
안녕하세요 여러분, 최근 저는 약 1억 5,200만 개의 파라미터를 가진 작고 가벼운 인과적 언어 모델 (causal language model)인 BetterGPT-150M의 사전 학습 (pre-training)을 마쳤습니다. 150억 (15B) 개의 토큰으로 학습되었습니다.
데이터셋 및 학습 (Dataset & Training): 선별된 데이터셋 (FineWeb-Edu, fine maths, cosmopedia, starcode-python 포함)을 사용하여 안정화 (stable) 및 어닐링 (annealing) 단계를 거쳐 학습되었으며, 토큰 효율성을 극대화하는 동시에 강력한 능력 유지를 보장했습니다.
성능 (Performance): 벤치마크 평가 결과, 이 모델은 GPT-2 Small보다 뛰어난 성능을 보이면서도 훨씬 더 큰 토큰 예산으로 학습된 모델들과 대등한 수준을 유지합니다.
많은 작거나 아주 작은 모델들이 거대한 LLM 출시들에 묻히는 경향이 있기 때문에, 가벼운 아키텍처 (architecture), 빠른 CPU 추론 (inference), 또는 작은 엣지 디바이스 (edge-device) 실험에 관심 있는 분들을 위해 이곳에 공유하고자 합니다.
저장소 (Repo): https://github.com/harikrish2727/BetterGPT
모델 허브 (Model Hub): https://huggingface.co/Harikrish2727/BetterGPT-150M
라이브 데모 (Live Demo): https://huggingface.co/spaces/Harikrish2727/BetterGPT-Demo (ZeroGPU에서 호스팅되며 토큰 스트리밍 지원)
모델 참고 사항 (Model Notes):
작업 (Task): 텍스트 완성 / 생성 (표준 베이스 완성형 모델이며, 지시어 미세 조정 (instruction-tuned) 모델이 아닙니다).
점유율 (Footprint): RAM/vRAM 점유율이 매우 낮으며, 표준 CPU에서 즉시 실행됩니다.
Space 데모에서 프롬프트를 자유롭게 시도해 보거나 가중치 (weights)를 내려받아 로컬에서 실행해 보세요. 피드백, 벤치마크 제안, 또는 지시어 미세 조정 (instruction fine-tuning)을 위한 아이디어는 언제나 환영합니다! 이것은 저의 첫 번째 진지한 시도이며, 여러분으로부터 진솔한 피드백을 받을 수 있기를 바랍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기