참고Reddit
이미지 생성 모델 학습 효율 개선을 위한 Danbooru 태그 데이터셋 정제본 공개
230만 건의 태그를 인간이 직접 검수·수정한 데이터셋으로 고품질 학습 시 참고 가능.
요약
최근 9,364개의 고유 태그를 인간이 직접 검수하여 230만 건의 Danbooru 태그를 수정 및 배포했다. 이번 수정 작업은 총 43만 건의 태그 삭제와 190만 건의 태그 추가를 통해 데이터의 정확도를 높였다. 현재 Oppai 모델은 2026년 중반의 데이터셋과 8월 말의 메타데이터를 사용하여 재학습 중이며, 애니메이션 이미지 데이터셋은 기존 520만 장에서 620만 장으로 확대되었다. 또한 사람을 제외한 풍경 및 무기 사진 11만 장이 추가되었으며, 데이터셋 내 깊게 박힌 노이즈를 제거하기 위한 튜닝 데이터셋 작업도 진행되고 있다. 모델 개발자는 조만간 다음 버전의 프리뷰를 공개할 예정이며, 데이터 교정을 도울 기여자를 상시 모집 중이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 2.3 million Danbooru tags corrected and released
원문 보기 ↗