Amazon, which started off selling books, is destroying rare texts to train AI

개요

Amazon이 희귀 서적을 구매하여 AI 훈련 데이터로 활용하기 위해 책을 절단하고 스캔하는 것으로 알려졌습니다.

주요 내용

* 404 Media의 조사에 따르면 Amazon은 희귀 서적을 대량으로 구매한 후 AI 훈련을 위해 스파인을 제거하고 스캔하고 있습니다.
* 추적 장치가 설치된 희귀 서적이 Las Vegas에 위치한 Amazon 시설(VGT3)로 들어간 것이 확인되었습니다.
* Amazon은 상업적 경로를 통해 책을 구매하여 고객이 사용하는 제품 및 서비스를 개선한다고 밝혔습니다.
* LLM 훈련에는 방대한 양의 텍스트 데이터가 필요하며, 희귀 서적은 인터넷에서 찾기 어렵거나 절판된 텍스트를 제공하여 새로운 훈련 데이터 소스가 됩니다.
* 2022년 이전에 출판된 텍스트는 LLM이 생성했을 가능성이 없어 모델 붕괴(model collapse) 위험을 줄여줍니다.
* LLM이 AI 생성 텍스트를 너무 많이 학습하면 출력 품질이 저하되는 모델 붕괴 현상이 발생할 수 있습니다.

시사점

Amazon의 희귀 서적 활용은 LLM 훈련을 위한 새로운 데이터 소스 확보 전략을 보여주지만, 문화재 보존 및 저작권 관련 윤리적, 법적 논의를 촉발할 수 있습니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions