New York Times says OpenAI hid evidence in ChatGPT copyright trial

개요

뉴욕 타임즈와 데일리 뉴스는 OpenAI가 저작권 침해 소송 과정에서 자체 학습 데이터셋 및 고객 채팅 기록에서 저작권이 있는 자료를 검색할 수 있는 능력을 숨겼다고 주장하며, 이는 OpenAI의 증거 인멸 및 증거 개시 절차 방해 혐의로 이어지고 있습니다.

주요 내용

* 저작권 침해 소송: 뉴욕 타임즈와 데일리 뉴스는 OpenAI가 자사의 저작권이 있는 콘텐츠로 생성형 AI 모델을 학습시키고 사용자 결과물에 이를 재현함으로써 저작권법을 위반했다고 주장하며 소송을 제기했습니다.
* OpenAI의 입장 변화: OpenAI는 소송 초기, 자체 학습 데이터셋을 검색할 능력이 없으며, 방대한 양의 ChatGPT 대화 기록을 검색하는 것은 기술적으로 부담이 되고 사용자 프라이버시 문제를 야기할 수 있다고 주장했습니다.
* 내부 검색 및 데이터베이스 존재 증거: 뉴욕 타임즈는 OpenAI 데이터 프라이버시 엔지니어의 법정 증언을 통해, OpenAI가 소송 제기 이전에 이미 자체 학습 데이터셋에서 저작권이 있는 저널리즘 작품을 검색하기 위한 내부 검색 및 평가를 수행했으며, 약 7,800만 건의 익명화된 ChatGPT 대화 데이터베이스를 내부적으로 축적하고 있었음을 밝혔다고 주장합니다.
* "Project Giraffe"와 "Bloom" 필터: 소송 제기 직후, OpenAI는 "Project Giraffe"라는 도구 세트의 일부로 "Bloom" 필터를 구현하여 출력물의 재현(regurgitation)을 탐지하고 기록했다는 주장도 나왔습니다.
* 증거 개시 절차 방해 주장: 원고 측은 OpenAI가 재판부가 명령한 샘플(2,000만 건) 제출 시 지나친 수정(redactions)을 가하여 "사용 불가능"하게 만들었으며, 소송 제기 후 재판부의 보존 명령을 직접 위반하여 수십억 건의 ChatGPT 출력을 삭제하고 요청 샘플에 수백만 건의 로그를 대체했다고 주장합니다.
* 원고 측의 법적 조치 요구: 뉴욕 타임즈와 데일리 뉴스는 OpenAI가 증거를 은닉하고 증거 개시 절차를 방해한 점에 대해 법원의 징계를 요구하고 있으며, 제출된 2,000만 건의 채팅 로그 샘플을 증거로 사용하지 못하게 하고, ChatGPT 로그가 원고 콘텐츠의 상당한 재현을 보여준다는 사실을 인정하며, OpenAI가 해당 증거를 추적하는 데 발생한 법률 비용을 지불하도록 요청하고 있습니다.
* OpenAI의 반박: OpenAI 대변인은 해당 혐의를 부인하며, 뉴욕 타임즈가 사건이 약화됨에 따라 사적인 사용자 대화에 침입하려 한다고 비난하고, 사용자 프라이버시와 공정 이용 원칙을 옹호할 것이라고 밝혔습니다.

시사점

OpenAI가 소송 과정에서 핵심적인 기술적 능력과 데이터 수집 사실을 숨겼다는 주장이 사실로 밝혀질 경우, 저작권 소송의 진행뿐만 아니라 AI 모델 학습 데이터의 투명성 및 증거 개시 절차의 신뢰성에 중대한 영향을 미칠 수 있습니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions