이야기 쓰기가 가능한 약 2만 개 매개변수(가장 작은 규모)의 언어 모델
요약
매개변수 수가 약 2만 개에 불과한 'MacroStories'라는 초소형 언어 모델이 공개되었습니다. 이 모델은 범용적인 LM이라기보다는 제한된 이야기 분포 내에서 일관성 있는 서사 생성에 특화되어 있습니다. 매우 작은 크기 덕분에 GPU 없이도 CPU에서 빠르게 실행할 수 있다는 장점이 있습니다.
핵심 포인트
- 매개변수 약 2만 개 규모의 초소형 언어 모델 'MacroStories' 공개.
- 범용 LM이 아닌, 제한된 이야기 서사 생성에 특화됨.
- CPU에서 구동 가능하며 GPU가 필요 없어 접근성이 높음.
- 서사 생성의 하한선을 탐구하는 연구 목적을 가짐.
저는 TinyStories 스타일의 모델 크기를 계속 줄여왔는데, 이것이 지금까지 가장 작은 모델입니다: MacroStories — 19,969개의 매개변수, 81 KB FP32 https://huggingface.co/raincandy-u/MacroStories 규모를 비교하자면: → 1M TinyStories 모델보다 약 50배 작음 → AlexNet보다 약 3,000배 작음 → 32차원 은닉 상태 → 378 토큰 어휘 → 공유 가중치로 재귀적으로 4번 적용된 디코더 블록 하나입니다. 명백히 범용적인 LM은 아니지만, 제한된 이야기 분포 내에서는 목표, 문제, 관련 행동 및 해결책을 갖춘 100~300단어의 서사를 유지할 수 있습니다. 또한 CPU에서 매우 빠르게 실행되며 GPU가 필요하지 않습니다. 저는 주로 일관성 있는 서사 생성에 대한 하한선을 얼마나 밀어붙일 수 있는지에 관심이 있습니다. 사람들이 어떻게 이 한계를 돌파하는지 궁금합니다.☺️ /u/x_Raincandy_x 님이 제출함 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기