검색은 남기고 AI 학습만 거부한다…Cloudflare 설정의 함정

|작성자: QUASA 편집팀|4 분 소요| 3
검색은 남기고 AI 학습만 거부한다…Cloudflare 설정의 함정

Cloudflare가 2026년 9월 15일 검색 크롤링을 유지하면서 AI 학습 이용은 거부할 수 있는 Disallow AI Training을 출시했다. 같은 날 Training의 Block과 Block on pages with ads 적용 범위에는 Googlebot·Applebot·Bingbot 같은 혼합 목적 크롤러가 포함됐다. Cloudflare의 공식 발표 에 명시된 핵심은 Disallow는 검색 경로를 남기지만 Block은 검색용 접근까지 끊는다는 차이다.

검색 노출을 유지하고 모델 학습만 거부하려면 Search를 Allow로, Training을 Disallow AI Training으로 설정해야 한다. 반대로 Training에서 Block을 고르면 Search가 Allow여도 혼합 목적 크롤러에는 더 강한 차단이 적용될 수 있다. Agent는 별도 항목이어서 AI 도구의 실시간 페이지 방문 허용 여부도 따로 결정해야 한다.

Disallow는 선호를 전달하고 Block은 접속을 끊는다

Cloudflare는 크롤러의 행동을 Search, Training, Agent로 구분한다. Search는 검색 색인을 위한 수집, Training은 모델 학습이나 미세 조정을 위한 수집, Agent는 사용자를 대신한 실시간 방문을 뜻한다. 하나의 크롤러가 둘 이상의 행동을 맡으면 혼합 목적 크롤러로 분류된다.

Disallow AI Training을 선택하면 Bot Preference Sync가 지원되는 학습 거부 지시를 robots.txt에 게시한다. Cloudflare가 Accountable로 분류한 Googlebot·Applebot·Bingbot은 검색을 위해 계속 접근할 수 있으며, 별도로 식별되는 학습 전용 크롤러와 그 밖의 Training 크롤러는 차단된다. 이 선택지는 Training에만 있고 Search와 Agent에는 없다.

다만 Disallow는 모든 사업자와 크롤러를 기술적으로 동일하게 차단하는 스위치가 아니다. 혼합 목적 크롤러에는 운영자가 학습을 허용하지 않는다는 선호를 전달하고, 이를 준수할 능력이나 기한을 제시한 사업자에 검색 접근을 남기는 방식이다. robots.txt를 무시하거나 목적을 숨기는 크롤러까지 지시문 하나로 통제한다는 의미는 아니다.

네 가지 Training 선택지의 결과는 다음과 같다.

  • Allow: Training 정책 자체는 차단을 추가하지 않는다. WAF나 사용자 지정 규칙 등 다른 계층의 차단은 그대로 적용될 수 있다.
  • Disallow AI Training: 학습 거부 선호를 게시하고, 기준을 충족한 혼합 목적 크롤러에는 검색 접근을 남긴다. 구분 가능한 학습 전용 크롤러는 차단한다.
  • Block on pages with ads: Cloudflare가 광고를 표시한다고 감지한 페이지에서 Training 크롤러를 차단한다. 혼합 목적 크롤러도 포함되므로 해당 페이지의 검색 수집에 영향을 줄 수 있다.
  • Block: 사이트 전체에서 Training 크롤러를 차단한다. Googlebot·Applebot·Bingbot의 검색용 접근도 함께 중단될 수 있다.

Search를 Allow로 둬도 검색 접근이 보장되지는 않는다

설정의 함정은 여러 정책 가운데 가장 제한적인 결과가 실제 요청에 적용될 수 있다는 데 있다. Search가 Allow여도 Training의 Block이 같은 Googlebot 요청을 막으면 검색 수집은 실패한다. 광고 페이지에만 적용되는 Block on pages with ads도 대상 범위가 좁을 뿐, 그 페이지에서는 같은 문제가 생길 수 있다.

Agent 정책은 다시 별개다. Search를 Allow, Training을 Disallow AI Training으로 두고 Agent를 Block으로 설정하면 전통적인 검색 수집은 허용하면서 사용자를 대신해 페이지를 가져오는 AI 도구는 막을 수 있다. 반대로 Agent를 Allow로 두었다고 해서 모델 학습까지 허용되는 것은 아니다.

Allow 역시 최종 접근을 보장하는 표현은 아니다. AI Crawl Control의 개별 크롤러 설정, WAF, 사용자 지정 보안 규칙, Bot Fight Mode, 원본 서버의 robots.txt가 별도로 요청을 제한할 수 있다. 따라서 범주별 정책과 실제 응답은 서로 다른 층에서 확인해야 한다.

광고 사이트와 비광고 사이트의 새 권장값이 다르다

9월 15일부터 새 도메인에는 광고 수익화 여부에 따라 두 가지 권장 구성이 제시된다. 광고를 표시하는 사이트는 Search를 Allow, Training을 Disallow AI Training, Agent를 Block on pages with ads로 두며 Bot Preference Sync를 활성화한다. 검색 색인은 열어 두면서 학습 거부 의사를 전달하고, 광고가 있는 페이지에서는 에이전트 방문을 제한하는 조합이다.

광고로 수익화하지 않는 사이트에는 Search·Training·Agent를 모두 Allow로 두는 구성이 제시된다. 두 구성 모두 온보딩 중이나 이후에 변경할 수 있다. 따라서 새 Cloudflare 도메인이 모두 AI 학습을 기본 차단한다거나 모든 AI 관련 크롤러가 광고 페이지에서 차단된다고 일반화하면 실제 정책과 어긋난다.

기존 설정은 자동 이전됐지만 결과값은 확인해야 한다

이전의 Block AI Bots를 Block 또는 Block on pages with ads로 사용하던 도메인은 Search Allow, Training Disallow AI Training, Agent Block on pages with ads로 이전된다. 종전 스위치를 사용하지 않은 도메인은 세 범주가 모두 Allow로 옮겨진다. 이미 세부 제어를 사용했다면 과거 Training의 Block과 Block on pages with ads가 Disallow AI Training으로 바뀌어 이전 정책의 실질적 효과를 보존한다.

Search Engine Journal의 9월 15일 보도 도 기존 Training 차단 선택이 Disallow AI Training으로 이전되고, 새 체계의 Block은 혼합 목적 크롤러를 검색 용도까지 완전히 막는다고 확인했다. 자동 이전은 검색 접근을 갑자기 끊지 않도록 설계됐지만, 이름이 같은 Block의 새 적용 범위가 과거와 달라졌다는 점은 구분해야 한다.

확인 대상은 Security Settings의 Search·Training·Agent 값, Bot Preference Sync가 반영된 최종 robots.txt, 개별 크롤러 차단, WAF와 사용자 지정 규칙이다. 기존 robots.txt의 Disallow 지시문도 유지될 수 있으므로 대시보드에서 Allow만 확인하고 검색 접근이 열린 것으로 단정할 수 없다.

Bing과 AI 검색 요약은 아직 별도 문제다

Google은 Google-Extended, Apple은 Applebot-Extended를 통해 학습 거부 선호를 처리하지만 Microsoft의 도메인 단위 robots.txt 지원은 아직 완성되지 않았다. ITmedia의 9월 17일 보도 에 따르면 Microsoft는 2027년 초 지원을 목표로 하고 있으며, 그전까지 Bing의 학습 이용을 거부하려면 NOARCHIVE 같은 별도 제어가 필요하다. Disallow AI Training을 선택해도 Bingbot의 검색 접근은 유지되지만 학습 거부 선호가 robots.txt를 통해 자동 전달되지는 않는다.

AI 학습과 생성형 검색 요약도 같은 용도가 아니다. Disallow AI Training은 모델을 만들거나 미세 조정하는 이용을 다루며, 검색 결과의 AI 요약에 콘텐츠가 표시되는지는 각 검색 사업자의 별도 제어를 따른다. 따라서 현재의 설정은 검색 접근과 학습 이용을 분리했지만, 모든 AI 활용을 하나의 스위치로 거부하는 기능은 아니다.

확정된 변화는 분명하다. 검색을 유지하려면 Training에서 Disallow AI Training을 써야 하며, Block 계열은 혼합 목적 크롤러의 검색 접근까지 제한할 수 있다. 다만 Bing의 robots.txt 지원과 사업자별 AI 요약 제어가 완성되기 전까지는 설정 이름만으로 모든 이용 목적의 차단 여부를 판단할 수 없다.

함께 읽기:

공유:

뉴스레터 구독

최신 Web3, AI, 암호화폐 뉴스를 이메일로 받아보세요.

0