Anthropic shares more details about how Claude’s new watermarks will work

개요

Anthropic은 EU AI Act의 투명성 규정 준수를 위해 Claude 챗봇이 생성하는 텍스트에 워터마크를 도입하며, 이 워터마킹 기술의 작동 방식, 편집에 대한 영향, 코드 생성 시 적용 등에 대한 상세 정보를 공유했습니다.

주요 내용

* Claude의 워터마킹은 독자에게는 감지되지 않지만, 특정 키를 가진 분석가에게는 감지 가능한 패턴을 텍스트에 삽입하는 방식으로 작동합니다.
* 워터마킹은 Claude의 응답 품질에 영향을 미치지 않으며, 워터마크가 있는 텍스트와 없는 텍스트는 육안으로 구별할 수 없습니다.
* Anthropic은 Google DeepMind가 2024년에 발표한 SynthID-Text 접근 방식을 사용하며, 워터마크 감지를 위한 API를 출시할 계획입니다.
* 워터마킹은 AI가 생성한 텍스트의 "특징(tells)"을 찾는 기존 AI 탐지 방식과는 근본적으로 다르다고 명시했습니다.
* 텍스트 편집 시, 가벼운 편집은 워터마크를 완전히 제거하지 못할 수 있지만, 모든 단어를 교체하는 완전한 재작성은 워터마크를 제거할 수 있습니다.
* Claude가 텍스트를 교정하거나 편집하는 경우, 워터마크의 유지 여부는 텍스트 길이와 편집 정도에 따라 달라지며, 가벼운 편집 시에는 워터마크가 적용될 여지가 적습니다.
* 코드 생성 시에는 작동 가능한 코드를 생성해야 하는 제약 때문에 워터마크 적용이 축소될 수 있으며, 주로 코드 내 주석과 같이 임의적인 선택이 가능한 부분에 적용될 수 있어 실제 코드에는 미미한 영향을 미칠 것입니다.
* Claude 외에도 다른 주요 AI 모델 개발자들이 동일한 행동 강령에 서명하고 자체 워터마크를 구현할 예정입니다.

시사점

Claude의 워터마킹 기술은 AI 생성 콘텐츠의 투명성을 높이고 EU AI Act 규정을 준수하는 중요한 방안이며, 기술적으로는 사용자 경험에 영향을 최소화하면서도 콘텐츠 출처를 추적할 수 있는 가능성을 제시합니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions