Cloudflare's new AI traffic options for customers
개요
Cloudflare는 AI 봇으로 인한 웹사이트 소유자의 콘텐츠 통제권 상실 문제를 해결하기 위해 AI 트래픽 관리 옵션을 확장하고, 봇의 행동과 콘텐츠 사용 방식에 따라 분류하는 새로운 택소노미를 도입했습니다.
주요 내용
* AI 봇 문제 인식 변화: 초기에는 AI 학습을 위한 콘텐츠 무단 사용 및 보상 부재에 대한 우려가 컸으나, 이제는 콘텐츠 보호와 공정한 보상, 그리고 "모든 자동화를 차단하는" 것 이상의 세분화된 제어 옵션에 대한 요구가 커지고 있습니다.
* 새로운 봇 분류 기준: AI인지 여부보다는 봇의 행동, 즉 "사이트에서 무엇을 하는가", "무엇을 저장하는가", "콘텐츠를 어떻게 다시 공유하는가"에 초점을 맞춰 분류합니다.
* AI 사용 사례 분류 (Pragmatic Taxonomy):
* Search: 검색 엔진 결과에 표시하기 위해 콘텐츠를 수집하거나 인덱싱하는 행위 (보상 기대)
* Agent: 사람을 대신하여 실시간으로 작업을 수행하는 자동화된 행동 (ChatGPT-User, Gemini 등)
* Training: AI 모델을 학습시키거나 미세 조정하기 위해 콘텐츠를 사용하는 크롤러
* 다중 목적 봇 관리 강화: 단일 목적뿐만 아니라 여러 목적을 가진 봇은 모든 목적을 추적하도록 분류하며, 투명성 확보를 위해 목적별로 크롤러를 분리할 것을 권장합니다.
* AI 트래픽 관리 옵션 확장: 기존의 "AI 봇 차단" 옵션을 넘어 Search, Agent, Training의 세 가지 주요 사용 사례별로 AI 트래픽을 관리할 수 있는 기능을 제공하며, 무료 티어 고객도 이용 가능합니다.
* 새로운 기본 설정 (2026년 9월 15일 적용):
* 광고가 표시되는 페이지에서는 Training 및 Agent 분류의 봇을 기본적으로 차단하고, Search 분류는 기본적으로 허용합니다.
* Search와 Training을 결합한 다중 목적 크롤러는 모든 목적에 대한 규칙에 따라 허용/차단되며, 가장 제한적인 규칙이 적용됩니다. (예: Training을 차단한 경우 Googlebot, Applebot, BingBot 등은 차단됨)
* 고객은 이 기본 설정을 언제든지 변경할 수 있습니다.
* BotBase (Enterprise 고객 대상): 모든 알려진 봇 및 에이전트를 추적하는 데이터베이스를 제공하여, 봇의 분류 및 행동에 대한 포괄적이고 검색 가능한 뷰를 Cloudflare 대시보드에서 확인할 수 있습니다. 향후 봇 제어 센터 기능으로 확장될 예정입니다.
* 콘텐츠 사용 방식 (Content Use) 관리: 봇이 콘텐츠를 수집한 후 무엇을 저장하고 재사용하는지에 따라 immediate (상호작용만, 저장/재사용 없음), reference (인덱싱, 발췌, 링크 백), full (요약 및 재현) 세 가지 수준으로 관리할 수 있습니다.
* robots.txt 확장 (use 신호): Content Signals에 use 필드를 추가하여 use=immediate, use=reference, use=full 값을 지정함으로써 콘텐츠 사용 방식에 대한 선호도를 명시할 수 있습니다.
* Verified 봇 정의 변경: 과거에는 모든 Verified 봇이 기본적으로 허용되었으나, 이제는 Verified 라벨이 해당 분류 (예: Search)에 따라 접근을 허용하는 방식으로 변경되었습니다. Verified 봇이 되기 위한 과정은 더 투명해집니다.
* Transitive Trust (간접 신뢰) 실험: Forwarded 헤더를 활용하여 봇 소유 회사와 최종 사용자 간의 간접적인 신뢰 관계를 관리하는 방안을 제안합니다.
시사점
Cloudflare의 새로운 AI 트래픽 관리 옵션과 분류 체계는 웹사이트 소유자에게 콘텐츠에 대한 통제권을 강화하고, AI 기술 발전과 함께 변화하는 웹 환경에서 보다 투명하고 공정한 생태계를 구축하는 것을 목표로 합니다.
댓글
GitHub Discussions