
Hugging Face, 역대 최대 규모의 오픈 소스 코드 데이터셋인 The Stack v3 출시
요약
Hugging Face가 역대 최대 규모의 오픈 소스 코드 데이터셋인 The Stack v3를 출시했습니다. 사용자는 품질 필터링과 개인정보 삭제가 완료된 학습용 데이터셋 또는 114TB 규모의 전체 코퍼스를 선택하여 활용할 수 있습니다.
핵심 포인트
- The Stack v3는 역대 최대 규모의 오픈 소스 코드 데이터셋임
- 학습용(stack-v3-train)은 중복 제거 및 개인정보 삭제가 완료됨
- 전체 코퍼스(stack-v3-full)는 114TB 규모로 직접 구성 가능함
- Hugging Face Storage Bucket을 통해 대규모 데이터 제공
𝕏의 Anton Lozhkov로부터: https://x.com/anton_lozhkov/status/2080254608639701222 두 가지 진입 방법:
stack-v3-train - 중복 제거(near-deduplicated)가 거의 완료되었고, 품질 필터링(quality-filtered) 및 개인정보(PII)가 삭제(redacted)되었으며, 콘텐츠가 인라인(inline)으로 포함되어 있습니다. 해당 데이터셋을 point load_dataset 하여 바로 사용하세요. https://huggingface.co/datasets/HuggingFaceCode/stack-v3-train
stack-v3-full - 114 TB 전체 코퍼스(corpus)를 HF Storage Bucket으로 제공합니다: 모든 중복 항목이 클러스터 ID(cluster IDs)와 함께 유지되며, 제외된 파일들에 대한 스텁(stubs)이 포함되어 있습니다. 직접 중복 제거(dedup), 필터링(filters) 및 믹스(mixes)를 구성하여 사용하세요. https://huggingface.co/buckets/HuggingFaceCode/stack-v3-full
/u/Nunki08 제출 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기