“Zlibrary my beloved”: Anthropic staff chats extolling piracy cited in Sony suit

개요

Anthropic이 AI 학습을 위해 대규모로 저작권이 있는 서적을 불법 다운로드(토렌팅)한 사실이 소니(Sony), EMI, 워너 채플(Warner Chappell) 등 주요 음반 출판사들의 소송에서 제기되었다.

주요 내용

* 음반 출판사들은 Anthropic이 700만 권 이상의 서적을 불법 다운로드하여 AI를 학습시킨 후 15억 달러를 지급한 합의가 불충분하며, 불법 행위를 억제할 만큼 충분한 액수가 아니라고 주장한다.
* 이들 출판사는 Anthropic이 수많은 저작권이 있는 음악 작품들도 불법 토렌팅했으며, 이는 AI 생성 음악과 경쟁하는 작곡가들에게 피해를 주고 있다고 주장한다.
* 소송은 Anthropic 공동 창업자인 Benjamin Mann이 2021년 7월부터 Library Genesis(LibGen)에서 수백만 권의 불법 서적을 토렌팅했으며, CEO인 Dario Amodei도 이를 승인했다고 명시한다.
* LibGen 폐쇄 후에도 Z-Library를 통해 불법 서적 복사본에 접근했고, Anthropic 직원들은 "zlibrary my beloved"와 같은 메시지를 주고받으며 불법 복제물 사용을 찬양했다.
* 출판사들은 Anthropic이 LibGen과 Z-Library에서 다운로드한 수백 권의 악보 및 가사 포함 서적 메타데이터를 통해 음악 작곡에 대한 저작권을 침해했다고 주장하며, Claude AI 모델이 학습 과정에서 이러한 불법 복제물을 사용했을 가능성을 제기한다.
* Anthropic은 상업용 Claude AI 모델을 LibGen 및 PiLiMi에서 파생된 텍스트로 학습된 비상업적 AI 모델이 생성한 "합성 데이터" 또는 "강화 피드백"을 사용하여 훈련했다고 인정했으나, 이를 부정하지는 않았다.
* 출판사들은 Anthropic이 AI 모델의 "가드레일"을 위해 불법 토렌트한 서적을 이용하며, LLM 학습에서 LibGen을 중단했더라도 출력 텍스트가 원본과 너무 유사한지 확인하기 위해 LibGen 데이터셋을 계속 사용하고 있다고 주장한다.
* Anthropic은 이러한 주장을 "세 변호사의 세 번째 소송이며, 법원에 계류 중인 사건의 주장을 재활용하는 것"이라고 일축하며, 생성 AI 모델 훈련은 "변형적 공정 이용(transformative fair use)"이라고 주장한다.
* 작곡가들은 AI 생성 음악이 차트 상위권을 차지하면서 자신의 음악이 AI 학습에 사용된 것에 대해 시장 피해를 입고 있다고 주장하며, US Copyright Office는 AI 생성물이 특정 저작물과 실질적으로 유사하지 않더라도 해당 유형의 작업 시장에서 경쟁할 경우 로열티 풀을 희석시킬 수 있다고 지적했다.
* 출판사들은 Anthropic이 악보 및 노래 가사 등을 무단으로 사용했으며, 물리적 서적을 파기하여 디지털 사본을 제작하는 등 저작권을 침해했다고 주장한다. Claude 모델은 사용자가 요청하지 않아도 저작권이 있는 가사를 생성하거나, 사용자가 노래 코드 진행을 요청할 때 해당 코드와 함께 저작권이 있는 가사를 생성한다.
* Dario Amodei CEO는 저작권이 있는 작품을 합법적으로 구매할 수 있었음에도 불구하고, "법적/실무적/사업적 어려움"을 피하기 위해 토렌팅했다고 증언했으며, Anthropic은 라이선스 계약을 시도하지 않았다.
* 출판사들은 Anthropic의 훈련 데이터 출처에 대한 투명성을 요구하며, AI 모델의 훈련 데이터, 훈련 방법, 알려진 기능에 대한 명세서를 제출하도록 명령해야 한다고 주장한다.

시사점

Anthropic의 AI 훈련 과정에서 발생한 저작권 침해 논란은 AI 개발의 윤리적, 법적 경계에 대한 중요한 질문을 제기하며, 향후 AI 산업 전반의 데이터 수집 및 활용 방식에 대한 감독 강화와 투명성 확보의 필요성을 시사한다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions