Claude's new Scarlet Letter watermark is invisible—for now

개요

Anthropic은 유럽연합(EU)의 AI Act 준수를 위해 Claude 모델에서 처리된 모든 콘텐츠에 보이지 않는 워터마크를 곧 적용할 예정이며, 이는 AI 생성 콘텐츠뿐만 아니라 편집된 콘텐츠까지 포함합니다.

주요 내용

* EU AI Act 준수: EU AI Act는 AI 시스템 제공업체에게 AI 생성 또는 조작된 오디오, 이미지, 텍스트, 비디오 출력에 워터마크를 적용하도록 요구하며, Anthropic은 이에 맞춰 Claude 모델에 워터마크를 적용합니다.
* 모든 처리 콘텐츠 대상: Anthropic은 EU의 요구 사항을 넘어, AI 시스템이 '보조적 기능'을 수행하거나 사용자 텍스트를 '실질적으로 변경'하지 않는 경우에도 워터마크를 적용하는 "nuke it from orbit" 접근 방식을 사용합니다.
* 투명성 및 감지: 텍스트 워터마크는 사용자에게 보이지 않으며, 다른 생성 파일에는 지원되는 경우 디지털 서명된 출처 메타데이터가 포함됩니다. Anthropic은 향후 워터마크 감지 방법을 공개하여 기술 지원을 제공할 계획입니다.
* 우회 가능성 및 오해 소지: 텍스트 워터마크는 모델의 단어 선택 패턴에 영향을 미치지만, 다른 챗봇 시스템에 붙여넣거나 편집하면 파괴될 수 있습니다. 이미지 및 비디오의 경우 스크린샷, 녹화 또는 메타데이터 편집 도구를 통해 제거될 수 있습니다.
* 워터마크의 불완전한 정보: 감지된 워터마크는 콘텐츠가 Claude에 의해 처리되었음을 나타내는 신호일 뿐이며, 전적으로 conclusive하지 않습니다. 또한, 일반 사용자는 완전히 생성된 텍스트와 AI가 편집만 한 텍스트 간의 차이를 인지하기 어려울 수 있습니다.
* 과도한 워터마크 적용 가능성: Claude는 EU AI Act에서 면제되는 단순 교정, 요약 등의 작업에도 워터마크를 적용할 가능성이 높아, 사용자를 혼란스럽게 하고 출처 정보를 모호하게 만들 수 있습니다.
* EU AI Act와 워터마크 적용의 괴리: EU AI Act는 공개적으로 발행되는 AI 생성 텍스트에 대한 라벨링 규정도 포함하지만, 특정 조건에서는 워터마크가 적용된 텍스트라도 편집자가 검토하면 라벨링이 필요 없을 수 있어 모순적인 상황이 발생할 수 있습니다.
* Anthropic의 입장: Anthropic은 Claude 출력을 표시하는 것이 EU AI Act 준수 및 AI 생성 텍스트 식별을 위한 도구 제공의 일환이며, 텍스트 탐지 API를 제공할 계획이라고 밝혔습니다.

시사점

Anthropic의 Claude 워터마크 적용은 EU AI Act의 투명성 요구 사항을 충족하기 위한 조치이나, 기술적 우회 가능성, 오해 소지, 그리고 EU AI Act 규정과의 잠재적 괴리로 인해 AI 생성 콘텐츠의 신뢰성과 투명성 확보라는 본래 목적 달성에 대한 과제를 안고 있습니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions