Discord admits AI moderation bug wrongfully banned users over harmless images
개요
Discord의 AI 기반 콘텐츠 모더레이션 시스템에서 발생한 버그로 인해 지난 두 달 동안 8,000명 이상의 사용자가 스프레드시트, 체스보드, 게임 텍스처, 투명 배경 이미지 등 무해한 이미지를 유해 콘텐츠로 오탐하여 부당하게 차단되었습니다.
주요 내용
* Discord의 AI 안전 시스템은 업로드된 콘텐츠를 알려진 유해 자료 데이터베이스와 대조하여 작동하며, 이 과정에서 때때로 오탐(false positives)이 발생할 수 있습니다.
* 일반적으로 AI가 플래그를 지정한 콘텐츠는 신뢰 및 안전 팀의 인간 검토를 거치지만, 이번 버그로 인해 오탐된 계정이 즉시 차단되는 문제가 발생했습니다.
* 이 버그는 5월부터 영향을 미치기 시작했으며, 주말 동안 200명의 추가 사용자가 차단된 후 팀이 문제를 식별하고 수정했습니다.
* 사용자들은 격자 패턴이 포함된 이미지 때문에 영구 정지되었다고 주장하며, 이러한 격자 패턴이 NSFW 및 아동 착취 콘텐츠를 은폐하는 데 사용되었기 때문에 AI가 민감해진 것으로 추측하고 있습니다.
* 영구 계정 차단은 사용자의 업무, 게임 커뮤니티, 소셜 연결에 심각한 영향을 미칠 수 있으며, AI 오탐으로 인한 피해는 상당합니다.
* Discord는 재발 방지를 위한 추가적인 안전 장치를 개발 중이며, 현재 영향을 받은 모든 계정은 복원될 예정입니다.
* Discord 외에도 Instagram, Facebook Groups, Tumblr 등 다양한 플랫폼에서도 AI 기반 모더레이션 시스템의 오탐 및 사용자 불만 사례가 보고된 바 있습니다.
시사점
AI 기반 콘텐츠 모더레이션 시스템의 오탐 가능성과 이로 인한 사용자 피해는 플랫폼들이 자동화된 시스템에 의존함에 따라 점점 더 중요해지는 과제이며, 향후 AI 시스템의 정확성 향상과 더불어 투명성 및 인간 검토 프로세스의 강화가 요구됩니다.
댓글
GitHub Discussions