AI companies destroy physical books – let's scan rare books before it's too late

개요

AI 기업들이 LLM 학습 데이터를 확보하기 위해 수백만 권의 물리적인 책을 구매, 스캔 후 파기하는 행태를 보이고 있으며, 이에 Anna's Archive는 희귀 서적을 포함한 인류의 지적 유산을 영구히 보존하기 위해 전 세계 자원봉사자들의 참여를 촉구하고 있습니다.

주요 내용

* AI 기업의 도서 파기: Anthropic의 "Project Panama"와 같이 일부 AI 기업들은 2022년 이전의 "기계가 접하지 않은" 학습 데이터를 확보하기 위해 수백만 권의 중고 서적을 구매하여 스캔 후 파기하고 있습니다.
* 배경 및 목적: 이러한 행위는 경쟁사의 학습 데이터 사용을 방지하고 법적 위험을 회피하며, 파기 비용이 무손실 스캔보다 저렴하다는 이유로 이루어지고 있습니다. 결과적으로 AI 기업들은 해당 디지털 복사본을 독점하게 됩니다.
* 지식 접근성의 역설: AI 기업들이 "인류 지식에 대한 접근성 향상"을 약속하는 동시에, 물리적 지식의 가장 견고한 매체인 책을 파기함으로써 공공 영역의 방대한 지식 자원이 사라질 위험에 처해 있습니다.
* Anna's Archive의 대응: Anna's Archive는 이러한 지식 파괴에 맞서기 위해 전 세계 자원봉사자들에게 도서, 논문, 신문 등 다양한 자료를 스캔하여 업로드할 것을 요청하며, "디지털 도서관 알렉산드리아"를 구축하려는 계획을 추진하고 있습니다.
* 미래 콘텐츠의 위협: 2025년부터 AI 생성 콘텐츠가 인터넷의 절반 이상을 차지하게 되면서, 인간과 AI가 생성한 콘텐츠를 구분하기 어려워지고 궁극적으로 인간 문명의 기억이 AI에 의해 독점될 수 있다는 우려가 제기됩니다.
* 자원봉사자 참여 요청: 인류 문명의 기억이 독점되지 않고 미래 세대가 지식을 무료로 접할 수 있도록, 자원봉사자들이 책 스캔 및 업로드, 도서 구매 후 스캔, 기부 등 다양한 방식으로 기여할 것을 호소하고 있습니다.

시사점

AI 기업의 학습 데이터 확보 과정에서 발생하는 물리적 지식의 파괴는 인류의 문화유산과 공공 지식 접근성에 심각한 위협이 되므로, 지식의 영구적인 보존과 독점 방지를 위한 전 세계적인 협력과 참여가 시급함을 보여줍니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions