Coders Say They Already Found Workarounds to Claude’s Invisible Watermarks
개요
Claude 모델이 생성하는 텍스트에 삽입되는 보이지 않는 워터마크가 유럽연합(EU) AI Act 준수를 위한 조치임에도 불구하고, 개발자들은 이를 우회하는 방법을 신속하게 공개하고 있습니다.
주요 내용
- 워터마크 제거 코드의 바이럴 확산: Anthropic이 Claude 모델에 보이지 않는 워터마크를 삽입한다고 발표한 지 4시간 만에 개발자 Guillaume Meyer가 이를 제거하는 코드를 GitHub에 공개했으며, 해당 코드는 폭발적인 반응을 얻고 다수의 기여자들을 확보했습니다.
- 워터마크 제거의 동기: 워터마크 제거 시도는 AI 생성 콘텐츠에 대한 라벨링 의무화에 대한 반대 의견, 기술적 도전 의식, 그리고 콘텐츠 생성자들의 실질적인 필요성에 의해 이루어지고 있습니다.
- EU AI Act 및 워터마크 규제: EU AI Act는 모델 제공자에게 AI 생성 오디오, 이미지, 비디오, 텍스트에 기계가 감지할 수 있는 라벨을 부착하도록 규정하고 있으며, 이를 위반할 경우 벌금이 부과될 수 있습니다. 다만, 우회 도구 자체의 판매를 금지하고 있을 뿐 독립적인 도구 개발에는 법적 제약이 없습니다.
- 워터마크 기술 및 우려 사항: Anthropic의 워터마크 기술은 사람에게는 감지되지 않지만 기계는 감지할 수 있는 단어 선택 패턴을 이용하며, 이는 Google의 SynthID 기술에서 파생되었습니다. 이 기술은 AI 사용 여부 판단의 정확성 문제, 잠재적 오탐(false positive) 위험, 그리고 콘텐츠 품질 저하 가능성에 대한 우려를 낳고 있습니다.
- 워터마크 제거 방법의 다양성: Meyer 외에도 다른 개발자들은 비워터마크 LLM을 이용한 재작성, 구문 재배열, 단어 대체, Claude 응답 압축 후 번역 및 재번역 등 다양한 방법으로 워터마크 제거를 시도하고 있습니다.
- Anthropic의 대응 및 미래 전망: Anthropic은 EU AI Act 준수를 위해 워터마크를 도입했으며, Claude Code를 포함한 지원 모델의 출력에 적용할 것이라고 밝혔습니다. 또한, 텍스트 감지 API를 출시하여 사용자들이 자체적으로 AI 생성 콘텐츠를 식별할 수 있도록 지원할 계획입니다. 워터마크 감지 도구가 공개되면 현재 개발된 제거 방법들의 실효성이 최종적으로 검증될 것입니다.
시사점
AI 생성 콘텐츠의 투명성과 식별 가능성을 높이기 위한 워터마킹 기술 도입은 EU AI Act 준수를 위한 필수적인 움직임이지만, 기술적 한계와 우회 가능성으로 인해 완벽한 해결책이 되기까지는 상당한 진통이 예상됩니다.
원문을 불러오는 중...
댓글
GitHub Discussions