← promppy_ 실시간 AI 뉴스
참고Reddit

허깅페이스, 역대 최대 규모 오픈소스 코드 데이터셋 'The Stack v3' 공개

114TB 규모의 정제된 코드 데이터셋으로 LLM 사전학습 및 파인튜닝 연구에 중요한 자원.

요약

Hugging Face가 역대 최대 규모의 오픈 소스 코드 데이터셋인 The Stack v3를 공개했다. 이번 버전은 크게 두 가지 방식으로 접근 가능한데, 우선 stack-v3-train은 중복 제거, 품질 필터링, 개인정보(PII) 마스킹이 완료된 데이터셋으로 바로 모델 학습에 활용할 수 있다. 또한 stack-v3-full은 114TB 전체 코퍼스를 포함하며, 클러스터 ID와 제외된 파일들에 대한 정보를 그대로 유지해 사용자가 직접 중복 제거 및 필터링을 수행할 수 있도록 구성되었다. 데이터셋은 Hugging Face 데이터셋 허브와 스토리지 버킷을 통해 제공된다. LLM 학습을 위한 고품질 코드 데이터 확보에 관심 있는 실무자라면 활용을 고려해 볼 만하다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Hugging Face releases The Stack v3 – largest open code dataset yet

원문 보기 ↗
다음 뉴스 →

중요Cognition, '친구처럼 대화하는' AI 어시스턴트 Poke 인수

코딩 도구 Devin에 인격형 상호작용 접목. 에이전트 UX 설계 시 성격·대화톤이 차별화 요소로 부상.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스