![[대규모 데이터셋 출시] - SupraLabs/reasoning-corpus-4K-5M-v1 - 당신의 작은 SLM이 생각할 수 있도록 대표 이미지](https://preview.redd.it/b7ybs7nqx5fh1.png?width=140&height=58&auto=webp&s=8a629744b46c32894ab96b23f01e5271ad26e268)
[대규모 데이터셋 출시] - SupraLabs/reasoning-corpus-4K-5M-v1 - 당신의 작은 SLM이 생각할 수 있도록
요약
SupraLabs에서 소형 언어 모델(SLM)의 추론 능력을 향상시키기 위한 500만 개의 샘플을 포함한 Reasoning Corpus 데이터셋을 출시했습니다. 이 데이터셋은 사고 사슬(CoT)과 ChatML 형식을 포함하며, SFT 및 미세 조정에 최적화되어 있습니다.
핵심 포인트
- 500만 개의 행으로 구성된 대규모 추론 데이터셋 출시
- 모델의 사고 과정(thought_trace)을 포함한 고품질 데이터 제공
- 5k 시퀀스 길이로 설계되어 소형 모델(SLM) 미세 조정에 최적화
- ChatML 형식을 지원하여 다양한 모델 학습에 용이
https://preview.redd.it/b7ybs7nqx5fh1.png?width=3440&format=png&auto=webp&s=e6aaaa15cbe59debaae1ebb7fcd708167e86dc35 안녕하세요 r/LocalLLaMA 여러분! 저희가 다시 돌아왔으며, 오늘은 정말 놀라운 것을 가져왔습니다. 저희의 거대한 5M 샘플 Reasoning Corpus 데이터셋입니다. 이 데이터셋은 다음과 같은 500만 개의 행(rows)을 특징으로 합니다:
- repo_id --> 출처
- tok_len --> 총 토큰(token) 수
- user --> 사용자 프롬프트 (user prompt)
- thought_trace --> 모델의 정확한 사고 사슬 (chain-of-thought)
- assistant --> 최종 AI 모델의 답변
- ChatML --> ChatML 형식의 user, thought_trace 및 assistant
모든 샘플은 작은 모델의 SFT/미세 조정 (finetuning)에 완벽하게 맞도록 5k 시퀀스 길이(sequence length) 이내로 구성되어 있습니다.
Hugging Face의 데이터셋 링크 🤗: https://huggingface.co/datasets/SupraLabs/reasoning-corpus-4K-5M-v1
SupraLabs Hugging Face 조직 링크 🤗: https://huggingface.co/SupraLabs
또한, 저희의 작업을 지원하고 싶으시다면 Hugging Face에서 팔로우해 주시고, 저희의 작업을 공유 및 리뷰해 주시며, 원하는 만큼 많은 피드백을 주세요 ❤️🔥🤗
이미 250명 이상의 사람들이 저희와 저희의 작업을 신뢰하고 있습니다! 이 데이터셋이 여러분 모두에게 유용하기를 바라며, 이를 활용한 여러분의 창작물을 보고 싶습니다. 이 데이터셋은 이미 1k 이상의 다운로드와 80개 이상의 좋아요를 기록했습니다 - 다음 사용자가 되어보세요 🔥🎉
submitted by /u/LH-Tech_AI [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기