Introduction
Tous les articles consacrés aux robots d’IA vous mettent en garde contre la même erreur. Vous avez bloqué GPTBot lors de la vague de panique liée au scraping de 2023, vous dit l’avertissement, et vous avez accidentellement bloqué les nouveaux agents qui récupèrent des pages pour les citer dans des réponses en temps réel. Vous vouliez empêcher les robots d’entraînement de fonctionner et vous avez discrètement choisi de ne plus figurer parmi les recommandations.
Nous avons vérifié si cela se produisait réellement.
Sur 219 domaines, cela ne s’est produit aucune fois.
Pas « rarement ». Pas « dans quelques cas ». Pas « une seule fois ».
Méthode
Nous avons sélectionné les vingt premiers résultats naturels pour 26 requêtes commerciales réparties dans sept catégories : SaaS, e-commerce, finance, santé, voyages, habitat et marketing. Cela a donné 254 domaines uniques. Nous avons récupéré le fichier robots.txt de chacun d’entre eux le 28 juillet 2026, et 219 ont pu être résolus. Sept d’entre eux ne proposaient aucun fichier robots.txt, ce qui équivaut à tout autoriser.
Pour chaque domaine, nous avons comparé chaque agent utilisateur IA au fichier en utilisant la règle de priorité standard : le groupe d’agents utilisateur le plus spécifique l’emporte, de sorte qu’une correspondance exacte d’agent prévaut sur *. Un domaine est considéré comme bloquant un agent lorsque son groupe gagnant interdit l’accès à la racine du site sans autorisation plus spécifique.
Douze agents ont été vérifiés, classés en fonction de leur contenu.
| Agent | Opérateur | Flux |
| GPTBot | OpenAI | Formation |
| OAI-SearchBot | OpenAI | Références de recherche ChatGPT |
| ClaudeBot | Anthropic | Formation |
| Claude-SearchBot | Anthropic | Références de recherche Claude |
| PerplexityBot | Perplexity | réponses |
| DuckAssistBot | DuckDuckGo | réponses |
| Amazonbot | Amazon | réponses |
| CCBot | Common Crawl | un corpus utilisé par de nombreux modèles |
| Google-Extended | Formation de Gemini, pas de recherche | |
| Applebot-Extended | Apple | entraînement |
| Bytespider | ByteDance | formation |
| méta-agent externe | Meta | entraînement |
Résultats
77 % de ces domaines autorisent tous les agents IA. Vingt-trois pour cent en bloquent au moins un.
| Agent | Bloqué | Domaines le mentionnant explicitement |
| Bytespider | 20 % | 45 |
| CCBot | 20 % | 47 |
| ClaudeBot | 17 % | 50 |
| Google-Extended | 16 % | 46 |
| meta-externalagent | 16 % | 38 |
| PerplexityBot | 15 % | 44 |
| GPTBot | 14 % | 53 |
| Applebot-Extended | 14 % | 39 |
| Amazonbot | 13 % | 39 |
| Claude-SearchBot | 10 % | 22 |
| DuckAssistBot | 10 % | 24 |
| OAI-SearchBot | 9 % | 34 |
L’agent le moins souvent bloqué est celui qui récupère des pages que ChatGPT utilise comme sources. Les agents les plus souvent bloqués sont ceux qui effectuent du scraping pour constituer des corpus d’entraînement.
La plateforme tout-en-un pour un référencement efficace
Derrière chaque entreprise prospère se cache une solide campagne de référencement. Mais avec d'innombrables outils et techniques d'optimisation parmi lesquels choisir, il peut être difficile de savoir par où commencer. Eh bien, n'ayez crainte, car j'ai ce qu'il vous faut pour vous aider. Voici la plateforme tout-en-un Ranktracker pour un référencement efficace.
Nous avons enfin ouvert l'inscription à Ranktracker de manière totalement gratuite !
Créer un compte gratuitOu connectez-vous en utilisant vos informations d'identification
Cet ordre n’est pas le fruit du hasard, et c’est là l’essentiel de la conclusion.
Personne ne commet d’erreur. Chacun prend une décision
Prenons l’exemple des deux opérateurs qui exploitent à la fois un robot d’indexation d’entraînement et un robot de recherche.
| Bloque les deux | Bloque l'entraînement, autorise la recherche | Bloque la recherche, autorise l'entraînement | |
| OpenAI, GPTBot / OAI-SearchBot | 9 % | 5 % | 0 % |
| Anthropic, ClaudeBot / Claude-SearchBot | 10 % | 7 % | 0 |
Douze domaines bloquent GPTBot tout en autorisant délibérément OAI-SearchBot. Quinze font de même pour Anthropic. Il s’agit là d’une politique cohérente : ne vous entraînez pas sur mon contenu, mais citez-moi.
Personne ne fait l’inverse.
Deux autres chiffres vont dans le même sens. Seuls quatre domaines de l’échantillon entier utilisent une interdiction générale de type « User-agent: * », et un seul bloque un agent IA sans nommer explicitement aucun agent IA. Quiconque modifie ces fichiers sait quels agents existent et ce que chacun fait.
L’avertissement du secteur porte donc sur un problème qui, dans cet échantillon, n’existe pas. La question intéressante n’est pas de savoir si vous avez bloqué les agents de recherche par accident, mais si vous l’avez fait intentionnellement.
En effet, 18 % de ces domaines bloquent au moins un agent de recherche et 4 % les bloquent tous les quatre. Ces sites ont choisi de ne pas apparaître dans les réponses générées par l’IA, et d’après ces éléments, ils l’ont fait délibérément.
Les 5 façons de corriger votre situation dès aujourd’hui
-
Considérez l’entraînement et la recherche comme deux questions distinctes. Il s’agit de décisions différentes et le marché les a déjà séparées. La plupart des éditeurs veulent la seconde sans la première. Rédigez le fichier de cette manière plutôt que de traiter les « robots d’IA » comme une seule catégorie.
-
Nommez explicitement chaque agent. Seuls quatre domaines ici s’appuient sur le caractère générique, et pour une bonne raison : un simple « User-agent: * disallow » bloque des agents qui n’existaient pas lorsque vous l’avez rédigé, et bloquera des agents qui n’existent pas encore. Deux des agents les plus bloqués dans ces résultats, Bytespider et meta-externalagent, sont postérieurs à la plupart des conseils relatifs au fichier robots.txt qui circulent encore.
-
Vérifiez OAI-SearchBot et Claude-SearchBot par leur nom. Ces deux agents déterminent si vous pouvez être cité. Respectivement 9 % et 10 % de l’échantillon les bloque. Si vous faites partie de ce groupe sans l’avoir voulu, c’est cette ligne qu’il faut modifier, et c’est le seul élément de cette liste qui a un coût immédiat en termes de visibilité.
-
Effectuez un nouvel audit tous les trimestres. De nouveaux agents sont apparus à plusieurs reprises au cours de l’année écoulée. Un fichier rédigé il y a dix-huit mois comporte forcément des entrées manquantes, même s’il avait été rédigé avec le plus grand soin à l’époque.
-
Vérifiez en périphérie, pas seulement dans le fichier. Les règles de gestion des robots de votre CDN peuvent bloquer un agent que le fichier robots.txt autorise explicitement, et le fichier ne vous en dira rien. C’est le type de défaillance qui survit même à un fichier robots.txt parfait.
Un point de départ qui permet de distinguer les deux décisions :
# Citez-moi. Ces agents récupèrent des pages pour les citer dans des réponses en temps réel.
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
Rencontre avec RanktrackerLa plateforme tout-en-un pour un référencement efficace
Derrière chaque entreprise prospère se cache une solide campagne de référencement. Mais avec d'innombrables outils et techniques d'optimisation parmi lesquels choisir, il peut être difficile de savoir par où commencer. Eh bien, n'ayez crainte, car j'ai ce qu'il vous faut pour vous aider. Voici la plateforme tout-en-un Ranktracker pour un référencement efficace.
Nous avons enfin ouvert l'inscription à Ranktracker de manière totalement gratuite !
Créer un compte gratuitOu connectez-vous en utilisant vos informations d'identification
User-agent: DuckAssistBot
Allow: /
Ne m'utilisez pas pour l'entraînement. Remplacez ces lignes par « Allow » si vous n'êtes pas d'accord.
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Cette configuration est proche de celle déjà utilisée par douze à quinze domaines dans cet échantillon. Il s’agit désormais d’une position courante plutôt que d’une solution astucieuse.
Pourquoi rien de tout cela n’apparaît-il pas dans un rapport que vous générez déjà ?
Search Console rend compte de Googlebot. Elle ne mentionne pas OAI-SearchBot. Analytics rend compte des sessions, et un moteur qui ne vous cite jamais n’envoie aucune session à comptabiliser. Les outils de suivi de classement indiquent les positions, et vos positions ne sont pas affectées par tout cela.
La plateforme tout-en-un pour un référencement efficace
Derrière chaque entreprise prospère se cache une solide campagne de référencement. Mais avec d'innombrables outils et techniques d'optimisation parmi lesquels choisir, il peut être difficile de savoir par où commencer. Eh bien, n'ayez crainte, car j'ai ce qu'il vous faut pour vous aider. Voici la plateforme tout-en-un Ranktracker pour un référencement efficace.
Nous avons enfin ouvert l'inscription à Ranktracker de manière totalement gratuite !
Créer un compte gratuitOu connectez-vous en utilisant vos informations d'identification
Il existe deux façons de le détecter. Lire directement le fichier, ce qu’a fait cette étude. Ou remonter à la source à partir du symptôme à l’aide d’un outil de vérification de visibilité basé sur l’IA, en posant aux moteurs de recherche des questions spécifiques à votre catégorie selon un calendrier défini et en guettant la réponse indiquant qu’ils ne vous voient pas du tout.
L’audit des robots d’indexation à la base de cette étude est celui que nous effectuons chez Honeyb : il consiste à vérifier chaque agent nommé dans le catalogue ci-dessus par rapport aux règles du fichier robots d’un site, selon un calendrier régulier plutôt que de manière ponctuelle. L’accès est le premier des quatre éléments vérifiés. Les trois autres sont : si les moteurs de recherche vous recommandent, ce qu’il faut modifier précisément, puis la production et la mise en ligne du contenu modifié.
Deux limites qu’il convient de mentionner
Cet échantillon concerne les SERP commerciales américaines ; il est donc biaisé en faveur des grands éditeurs et des marques établies, qui disposent à la fois de la notoriété et des conseils juridiques nécessaires pour prendre une décision mûrement réfléchie en la matière. Un échantillon de sites de petites entreprises présenterait très probablement un tableau différent, et le scénario du blocage accidentel pourrait bien s’avérer vrai dans ce cas. Nous effectuerons ce test prochainement.
Par ailleurs, un fichier robots.txt enregistre une intention, et non une contrainte. Nous n’avons pas vérifié si ces domaines fournissaient effectivement du contenu à chaque agent, ce qui relève des règles du CDN et constitue souvent le point où un écart entre le fichier et la réalité a tendance à se creuser.
La plateforme à l’origine de cette étude est accessible à l’adresse honeyb.ai.

