참고AI타임스
아마존, AI 학습용 희귀 서적 대량 매입·스캔 정황
고품질 데이터 고갈에 대응한 독자적 데이터 확보 전략. 저작권 이슈와 별개로 데이터 수집처 다변화 가속.
요약
아마존이 AI 모델 학습 데이터를 확보하기 위해 희귀 서적을 대량 매입한 후 제본을 뜯어 스캔하는 정황이 포착되었다. 최근 고품질 텍스트 데이터의 고갈과 AI 생성 데이터 학습으로 인한 성능 저하 우려가 커지면서, 온라인상에서 구하기 어려운 절판본과 희귀 서적이 새로운 대안으로 주목받고 있다. 404미디어는 지난 17일(현지시간) 추적 장치를 부착한 희귀 서적의 이동 경로를 분석한 결과, 해당 서적들이 아마존의 라스베이거스 데이터 시설인 VGT3로 운송된 사실을 확인했다. 이번 사례는 AI 기업들이 데이터 부족 문제를 해결하기 위해 오프라인 자원을 데이터화하려는 움직임을 가속화하고 있음을 보여준다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 아마존, AI 학습데이터 확보 위해 희귀 서적 수집하고 파괴
원문 보기 ↗