Technologie

Cloudflare dissocie recherche et entraînement IA — « Block » peut couper l’indexation

|Auteur: Équipe éditoriale de QUASA|5 min de lecture
Cloudflare dissocie recherche et entraînement IA — « Block » peut couper l’indexation

Cloudflare a lancé le 15 septembre 2026 un réglage destiné aux propriétaires de sites qui veulent refuser l’entraînement de modèles sans sacrifier leur présence dans les moteurs de recherche. Selon l’annonce de Cloudflare, Disallow AI Training laisse les robots mixtes admissibles explorer les pages pour la recherche, tandis que Block peut désormais les arrêter entièrement.

Depuis cette même date, la distinction s’applique notamment à Googlebot, Applebot et Bingbot, que Cloudflare classe comme robots mixtes « Accountable ». Disallow AI Training est le choix prévu pour préserver leur fonction de recherche ; sélectionner Block pour le comportement Training peut au contraire empêcher leur exploration et, par conséquent, compromettre l’actualisation de l’index.

Disallow publie un refus sans bloquer la recherche

Disallow AI Training n’est pas un blocage uniforme. Par l’intermédiaire de Bot Preference Sync, Cloudflare publie dans robots.txt la préférence de non-entraînement correspondant à chaque opérateur. Les robots mixtes classés Accountable restent autorisés à explorer le site pour la recherche, parce que leurs opérateurs disposent d’un mécanisme séparant cet usage de l’entraînement ou se sont engagés à le mettre en œuvre dans un délai défini.

Pour les robots consacrés uniquement à l’entraînement, Cloudflare peut appliquer un blocage à la périphérie de son réseau sans toucher à un robot de recherche distinct. L’entreprise place notamment dans cette situation les robots d’entraînement d’Amazon, Anthropic, Meta et OpenAI. Le réglage Disallow AI Training n’est disponible que pour la catégorie Training, et non pour Search ou Agent.

La nuance reste importante : pour un robot mixte Accountable, « Disallow » désigne une consigne publiée dans robots.txt, pas une interdiction technique de récupérer la page. Son efficacité dépend donc du respect de la préférence par l’opérateur. Cloudflare réserve le blocage réseau aux autres robots d’entraînement qu’il identifie.

Quel réglage choisir selon l’objectif

Les contrôles Search, Training et Agent se cumulent, et la règle applicable la plus restrictive peut l’emporter. La décision peut être résumée ainsi :

  • Rester indexable et autoriser l’entraînement : conserver Allow pour Search et Training, sous réserve des autres règles de pare-feu et du robots.txt du site.
  • Rester indexable et refuser l’entraînement : laisser Search sur Allow et choisir Disallow AI Training pour Training. Les robots mixtes Accountable gardent alors leur accès de recherche.
  • Bloquer entièrement un robot mixte : choisir Block pour le comportement concerné. Googlebot, Applebot et Bingbot peuvent alors être arrêtés même lorsqu’ils explorent les pages pour alimenter un moteur de recherche.

Block on pages with ads suit la même logique que Block, mais seulement sur les pages où Cloudflare détecte de la publicité. Il peut donc rendre certaines pages d’un domaine accessibles au robot et en fermer d’autres. Ce n’est pas une simple préférence : l’accès aux pages détectées est effectivement bloqué.

L’effet sur le référencement n’est toutefois ni une désindexation instantanée ni une baisse de classement mesurable à l’avance. Un robot bloqué ne peut plus récupérer les pages visées ni leurs mises à jour ; à terme, leur présence et leur fraîcheur dans l’index peuvent en souffrir. Inversement, autoriser l’exploration ne garantit ni l’indexation ni une position particulière dans les résultats.

Les anciennes préférences changent automatiquement

Cloudflare abandonne progressivement les contrôles globaux Block AI Bots et Managed Robots.txt au profit des catégories Search, Training et Agent ainsi que de Bot Preference Sync. Pour les domaines qui n’avaient jamais utilisé les contrôles granulaires, une ancienne option Block ou Block on pages with ads est migrée vers Search sur Allow, Training sur Disallow AI Training et Agent sur Block on pages with ads.

Les domaines déjà configurés avec les contrôles granulaires suivent une autre table de migration : les anciennes valeurs Block et Block on pages with ads appliquées à Training deviennent Disallow AI Training. la vérification de Search Engine Journal confirme ces migrations et le fait que Block arrête désormais Googlebot, Applebot et Bingbot, recherche comprise.

Si l’ancien réglage global était désactivé, les trois catégories passent sur Allow. Pour les nouveaux domaines déclarant tirer des revenus de la publicité, le préréglage proposé laisse Search sur Allow, place Training sur Disallow AI Training et Agent sur Block on pages with ads. Ces choix restent modifiables pendant l’ajout du domaine ou ultérieurement.

Bing reste l’exception du dispositif

La séparation n’est pas encore uniforme entre les trois grands robots mixtes. Google utilise Google-Extended pour recevoir une préférence concernant certains usages d’entraînement, tandis qu’Apple propose Applebot-Extended. Ces jetons régissent l’utilisation de contenus récupérés par les robots principaux ; ils ne sont pas eux-mêmes des robots d’exploration séparés.

Microsoft ne prend pas encore en charge la préférence de non-entraînement transmise par robots.txt au niveau du domaine. l’analyse de TechWyse confirme que Disallow AI Training ne communique donc pas automatiquement ce refus à Bing par ce canal et que Microsoft vise une prise en charge au début de 2027. En attendant, le mécanisme indiqué pour Bing repose notamment sur la balise NOARCHIVE.

Refuser l’entraînement ne signifie pas non plus refuser toute présence dans une réponse générée par IA. L’entraînement d’un modèle, l’exploration destinée à constituer un index et l’utilisation ponctuelle d’une page pour produire un résumé correspondent à des usages distincts. Le réglage présenté ici porte d’abord sur Training et sur le traitement des robots qui partagent plusieurs fonctions.

Une séparation utile, mais pas une garantie universelle

Le choix cohérent pour conserver l’exploration classique tout en exprimant un refus d’entraînement est donc Search sur Allow et Training sur Disallow AI Training. Ce résultat suppose qu’aucune autre règle Cloudflare, règle WAF ou directive du site ne bloque le robot de recherche.

Block répond à un autre objectif : écarter complètement le robot, avec la conséquence assumée de couper aussi sa fonction de recherche lorsqu’il est mixte. La prise en charge promise par Microsoft et de futurs contrôles consacrés aux résumés générés restent à venir ; Disallow AI Training ne constitue pas, à ce stade, une interdiction technique universelle de tous les usages possibles d’un contenu.

À lire aussi:

Partager:

Abonnez-vous à notre newsletter

Recevez directement les dernières actualités sur le Web3, l’IA et les cryptomonnaies.

0