Microsoft says virtually nobody was grabbing NYT articles through its chatbot
개요
Microsoft의 Copilot은 AI 모델 학습에 사용된 뉴스 콘텐츠 및 도서와 상당한 수준의 중복을 보이는 결과물을 거의 생성하지 않는다고 주장합니다.
주요 내용
* Microsoft는 Copilot 채팅 로그 820만 건을 분석한 결과, 뉴스 콘텐츠와 16단어 이상 일치하는 응답은 59,545건에 불과하며, 이는 뉴스 콘텐츠를 AI 모델 기반으로 사용하는 키워드와 관련된 로그에서 추출된 것입니다.
* 조사 전문가에 따르면, 820만 건의 Copilot 대화에서 30단어 이상 일치하는 응답은 24건에 불과했으며, 평가된 212권의 도서 중 일치하는 내용이 있는 도서는 10건에 불과했습니다.
* The New York Times는 Microsoft의 분석 결과에 동의하지 않으며, Microsoft와 OpenAI가 자신들의 저작물을 상업적 제품 제작에 도용하고 저널리즘을 대체하며 비즈니스를 위협하고 있다고 주장합니다.
* Microsoft는 이러한 데이터가 저작권 콘텐츠를 AI 학습 데이터셋으로 사용하는 것이 공정 이용에 해당한다는 주장을 뒷받침한다고 보고 있으며, 결과 시스템은 원본과는 다른 목적을 위해 사용된다고 주장합니다.
* 이러한 법적 다툼은 출판사와 작가들이 Microsoft와 OpenAI를 상대로 제기한 소송의 일부이며, 원고들은 피고들이 자신들의 저작물을 기반으로 제품을 만들고 저작권 콘텐츠를 재현하여 직접 경쟁한다고 주장합니다.
시사점
Microsoft의 이번 주장은 AI 학습 시 저작물 사용에 대한 공정 이용 논쟁에 중요한 근거를 제시하며, AI가 기존 콘텐츠를 대체하는 수준의 결과물을 생성하지 않는다는 점을 강조합니다.
댓글
GitHub Discussions