갑자기 등장한 모델!
요약
작성자는 개인적인 취미로 60억 개의 토큰을 사용하여 아랍어 데이터에 특화된 0.2B 규모의 AI 모델(Horus Taleeq 0.2B Base)을 처음부터 훈련시켰습니다. 이 과정은 NVIDIA RTX PRO 6000 GPU에서 약 30시간 동안 진행되었으며, 총 비용은 $100.63으로 공개되었습니다.
핵심 포인트
- 개인적인 취미로 AI 모델 훈련 가능
- 아랍어 데이터에 특화된 소형 모델 개발 사례 제시
- 저비용(약 $100)으로도 모델 사전 학습 시연
- 모델과 관련 자료를 MIT 라이선스로 오픈소싱
최근에 저는 일에서 잠시 휴식을 취하기로 결정하고 키보드와 기술 및 AI 세계로부터 약 14일 동안 떨어져 지냈습니다. 제가 분명히 할 수 없는 일이었습니다. 결국 지난 네 날 동안은 처음부터 AI 모델을 훈련시키는 데 시간을 보냈습니다. 사실, 저는 AI 모델 훈련을 순전히 상업적인 것보다는 정말 즐기는 취미처럼 여깁니다. 또한 학문적인 측면과 오픈 소스 커뮤니티에도 매우 관심이 많습니다. 그래서 지난 며칠 동안 자유 시간에 60억 개의 학습 토큰으로 작은 0.2B 모델을 처음부터 훈련시켰습니다. 좋은 점은 이 모델을 아랍어 데이터만으로 훈련시켜 아랍어와 그 방언에 특화했다는 것입니다. 저는 사전 학습(pretraining) 단계에서 멈췄습니다. 이 모델은 하나의 NVIDIA RTX PRO 6000 Blackwell Server Edition GPU에서 약 30시간 동안 연속적으로 훈련되었습니다. 제가 멈춘 사전 학습 중 기본 모델을 훈련하는 총 비용은 100.63달러였습니다. 이 부분은 AI 모델 훈련이 항상 수백만 달러가 들 것이라고 생각하는 사람들에게는 아마도 충격적일 것입니다. 저에게는 완전히 정신을 놓거나, 벽을 돌아다니거나, TV를 보는 대신 할 수 있는 재미있는 활동일 뿐이었습니다. 오늘 저는 이 모델과 함께 학습 데이터 소스, 훈련 코드 등 모든 것을 MIT 라이선스로 학술 및 교육 목적으로 오픈소싱했습니다. 또한, 솔직히 말해서 훈련 후에 이 모델로 무엇을 해야 할지 전혀 알지 못했어요 haha. 그리고 이렇게 제가 자유 시간을 보냈습니다. 이 모델의 이름은 Horus Taleeq 0.2B Base입니다. 검색해 보시면 TokenAI에서 페이지를 찾으실 수 있을 겁니다. 여러분에게 유용하기를 바랍니다. /u/assemsabryy 제출 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기