Your CDN Might Be Blocking ChatGPT From Your Docs (And robots.txt Won't Show It)

개요

CDN(콘텐츠 전송 네트워크) 또는 WAF(웹 애플리케이션 방화벽) 설정이 robots.txt 설정과 무관하게 ChatGPT와 같은 AI 크롤러의 웹사이트 접근을 의도치 않게 차단할 수 있습니다.

주요 내용

  • AI 크롤러 차단 현황: 수천 개의 웹사이트를 감사한 결과, 약 27%가 주요 AI 크롤러(GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot 등)의 접근을 최소 하나 이상 차단하고 있었으며, 이는 robots.txt가 아닌 CDN 또는 WAF 레벨에서 발생합니다.
  • 차단 원인: 봇 보호 규칙의 기본 설정(알 수 없는 User-Agent 차단, JavaScript 없는 트래픽 제한, JavaScript 요구 등)이 AI 크롤러의 User-Agent와 충돌하는 경우가 많습니다.
  • 차단 확인 방법:
  • curl 또는 PowerShell 명령어를 사용하여 특정 User-Agent("GPTBot" 등)로 사이트에 접근했을 때 200이 아닌 상태 코드가 반환되는지 확인합니다.
  • CDN 또는 WAF의 엣지(edge) 로그에서 User-Agent별 403 오류 발생 빈도를 확인합니다.
  • 클라이언트 사이드 렌더링 문제: 일부 AI 크롤러는 JavaScript를 실행하지 않기 때문에, JavaScript를 통해 동적으로 로드되는 콘텐츠(H1, 본문 등)는 빈 페이지로 인식될 수 있습니다. 해결책으로 서버 사이드 렌더링을 권장합니다.
  • robots.txt 설정: AI 크롤러별로 접근 권한을 명시적으로 허용하는 robots.txt 규칙을 추가할 수 있습니다 (예: Next.js App Router의 MetadataRoute.Robots 사용). 하지만 이는 근본적인 해결책이 아니며, CDN/WAF 설정을 함께 확인해야 합니다.
  • 크롤링 가능성의 중요성: AI 크롤러가 콘텐츠에 접근할 수 있는 것은 기본적인 전제 조건이며, 이를 통해 추출 가능한 구조(직접적인 답변, 명확한 정의, 출처가 명시된 통계 등)를 제공해야 AI 기반 서비스에서 인용되거나 활용될 수 있습니다.

시사점

CDN 및 WAF의 봇 차단 정책이 AI 크롤러의 웹사이트 접근에 예상치 못한 영향을 미칠 수 있으므로, robots.txt 설정과 함께 엣지 레벨의 차단 규칙 및 클라이언트 사이드 렌더링 방식을 점검하는 것이 중요합니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions