
Fineweb-edu 데이터셋의 1B 토큰으로 0.5M 모델을 학습시켰습니다.
요약
Silia-v2 신경망 구조에 대한 연구 내용을 소개합니다. 0.5M 파라미터 규모의 모델을 Fineweb-edu 데이터셋 1B 토큰으로 학습시켰으며, 이전 버전의 연산 효율성 문제를 개선했습니다.
핵심 포인트
- 0.5M 파라미터 규모의 초소형 모델 학습
- Fineweb-edu 데이터셋 1B 토큰 활용
- DeepSeek MLA와 Attention Free Transformer 결합을 통한 연산 효율 개선
- HellaSwag, PIQA 등 주요 벤치마크를 통한 성능 비교 수행
안녕하세요 여러분, 약 한 달 전 저는 Silia라고 불리는 저의 신경망 구조(neural network architecture)에 대한 첫 번째 연구 논문을 발표했습니다. 모델은 여기에서 확인하실 수 있습니다: https://huggingface.co/Srijan-Srivastava/Silia-v2 수정된 논문이 huggingface에 링크되어 있지만, 여기에도 첨부합니다: 1. https://zenodo.org/records/21510341 2. https://huggingface.co/Srijan-Srivastava/Silia-v2/blob/main/Silia%3A%20Tiny%20Scale%20Is%20All%20I%20Can%20Spare%20To%20Play%20With%20Transformer.pdf 모든 코드는 https://github.com/SrijanSriv211/Silia 에서 찾을 수 있습니다. 저는 모델의 벤치마크(benchmarking)를 수행하지 않았고 학습 플롭스(training flops)를 언급하지 않았다는 비판을 받았습니다. 또한 잔차 연결(residual connections)과 v1에서 연산 요구 사항이 2.5배 증가했던 문제에 관한 피드백도 받았습니다. 이번 수정본에서는 이 중 두 가지 문제를 해결했습니다. 저는 HellaSwag, PIQA, LAMBADA 벤치마크에서 LH-TechAI의 Quark-v2, Spark-v4 및 SupraLabs의 SupraMini-v6와 모델을 비교 벤치마크했습니다. SupraMini-v5와도 모델을 비교하고 싶었지만, 제가 알기로는 해당 모델이 이 세 가지 벤치마크 중 어느 것도 수행하지 않았기에 제외했습니다. 저는 DeepSeek의 MLA (decoupled RoPE 없이) + Apple의 Attention Free Transformer를 결합한 Qwen의 HydraHead를 사용하여 연산 및 메모리 요구 사항의 2~2.5배 증가 문제를 해결했습니다. Kimi Delta Attention 대신 Attention Free Transformer를 선택한 이유는 단순히 단순함 때문이며, 이 규모에서는 AFT만으로도 충분하기 때문입니다. 왜 잔차 연결(residual connections)에 대한 피드백을 다루지 않았는지, 그리고 왜 이 논문에서 학습 플롭스(training flops)를 언급하지 않았는지에 대해서도 말씀드리겠습니다. Kimi의 Attention Residuals 논문을 구현하고 싶었지만, 코드와 구조, 그리고 논문을 단순하고 깔끔하게 유지하기 위해 그 아이디어를 포기하기로 결정했습니다. 여기서 매우 솔직하게 말씀드리겠습니다. 제가 학습 플롭스(training flops)를 이 논문에 언급하지 않은 이유는 그것을 어떻게 제대로 보고해야 하는지 모르기 때문입니다. DeepSeek나 ChatGPT를 사용하여 도움을 받을 수도 있었겠지만, 솔직히 말해서 너무 귀찮았습니다.
이 모델은 0.5M 파라미터(parameters)를 가지고 있으며, Fineweb-edu 데이터셋의 총 1B 토큰을 사용하여 3 에포크 (epochs) 동안 학습되었습니다. 벤치마크 결과, 학습 손실 (training loss) 결과 및 아키텍처 다이어그램 (architecture diagram)을 첨부했습니다. 이 모델이 마음에 드셨으면 좋겠네요. 감사합니다! :) /u/SrijSriv211 제출 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기