참고Reddit
허깅페이스, 역대 최대 규모 오픈소스 코드 데이터셋 'The Stack v3' 공개
114TB 규모의 정제된 코드 데이터셋으로 LLM 사전학습 및 파인튜닝 연구에 중요한 자원.
요약
Hugging Face가 역대 최대 규모의 오픈 소스 코드 데이터셋인 The Stack v3를 공개했다. 이번 버전은 크게 두 가지 방식으로 접근 가능한데, 우선 stack-v3-train은 중복 제거, 품질 필터링, 개인정보(PII) 마스킹이 완료된 데이터셋으로 바로 모델 학습에 활용할 수 있다. 또한 stack-v3-full은 114TB 전체 코퍼스를 포함하며, 클러스터 ID와 제외된 파일들에 대한 정보를 그대로 유지해 사용자가 직접 중복 제거 및 필터링을 수행할 수 있도록 구성되었다. 데이터셋은 Hugging Face 데이터셋 허브와 스토리지 버킷을 통해 제공된다. LLM 학습을 위한 고품질 코드 데이터 확보에 관심 있는 실무자라면 활용을 고려해 볼 만하다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Hugging Face releases The Stack v3 – largest open code dataset yet
원문 보기 ↗