Bloquer ChatGPT dans robots.txt ne protège pas vos pages. ChatGPT-User, le robot qui va chercher une page pour répondre à un utilisateur, peut ignorer votre fichier, et OpenAI l'écrit dans sa documentation. Pire, si vous bloquez le mauvais robot, OAI-SearchBot, votre site sort des réponses de ChatGPT sans être mieux protégé.
L'été 2026 a donné deux leçons. Le 17 août, Abondance a relayé l'étude TollBit sur le premier semestre 2026, environ 15 % des robots IA de type « fetcher » identifiés en Europe ont accédé à des URL interdites. Le 28 juillet, Search Engine Land racontait comment des conversations partagées de Claude s'étaient retrouvées dans Google, un cumul de Disallow et de noindex étant l'explication avancée par la presse SEO, une configuration classique, que le cumul d'un Disallow et d'un noindex suffit à produire sur n'importe quel site.
Agence digitale à Paris depuis 1999, nous vendons du SEO et du référencement IA, autant l'annoncer d'emblée. Nous avons lu la documentation d'OpenAI sur ses robots, la synthèse publique du rapport TollBit, la documentation Google sur les fonctionnalités d'IA et les deux articles de presse avant d'écrire, et nous signalons ce qui reste une affirmation de média.
Dans ce guide, les trois robots d'OpenAI, ce que robots.txt ne peut pas faire, le blocage qui coûte cher, la leçon du noindex, ce qui protège vraiment, et une matrice de décision par objectif.
Les trois robots d'OpenAI, et ce que chacun fait
Le premier réflexe d'un dirigeant qui veut « bloquer ChatGPT » est d'ajouter une ligne dans robots.txt. Le problème, c'est que ChatGPT n'est pas un robot mais trois qui comptent ici, un quatrième, OAI-AdsBot, ne visitant que les pages d'atterrissage des annonces, et la documentation d'OpenAI précise que chaque réglage est indépendant des autres.
- OAI-SearchBot. Le robot de la recherche, celui qui fait remonter les sites dans les fonctions de recherche de ChatGPT. Selon OpenAI, un site qui le bloque « will not be shown in ChatGPT search answers, though can still appear as navigational links ». OpenAI recommande de l'autoriser et d'accepter ses plages d'IP publiées.
- GPTBot. Le robot de l'entraînement. Le bloquer indique que votre contenu ne doit pas servir à entraîner les modèles de fondation d'OpenAI, rien de plus.
- ChatGPT-User. Le robot à la demande. Quand un utilisateur pose une question dans ChatGPT ou dans un GPT personnalisé, il peut visiter une page pour répondre. Il n'explore pas le web de façon automatique et, selon OpenAI, ne sert pas à décider si un contenu apparaît dans la recherche.
Pour la définition et la syntaxe du fichier, notre fiche sur le fichier robots.txt fait le tour, ici nous restons sur ce que l'été 2026 a changé.
Ce que robots.txt ne peut pas faire, le fetch à la demande
La phrase qui a fait réagir la presse SEO en août est dans la documentation d'OpenAI, au sujet de ChatGPT-User, « Because these actions are initiated by a user, robots.txt rules may not apply ». Quand un prospect demande à ChatGPT de lire votre page de tarifs, OpenAI considère que les règles de votre fichier peuvent ne pas s'appliquer. Perplexity avance le même argument pour Perplexity-User, selon Abondance, et Anthropic affirme que ses trois robots respectent le fichier, affirmation relayée que nous n'avons pas vérifiée.
TollBit a mesuré l'écart entre la règle et la réalité. Cet éditeur d'outils de contrôle d'accès pour les éditeurs de contenu publie un rapport State of the Bots sur les deux premiers trimestres 2026, à partir des sites de son réseau. D'après ce rapport, relayé par Search Engine Journal le 14 août 2026 puis par Abondance le 17 août, environ 15 % des robots IA de type « fetcher » identifiés en Europe ont accédé à des URL marquées interdites. ChatGPT-User, Bytespider et Youbot sont en tête, chacun a atteint des pages interdites sur près de la moitié des sites européens qui les avaient explicitement bloqués, ChatGPT-User devant.
Précision de méthode, TollBit compte toute requête vers une URL interdite comme un contournement, quelle que soit la justification de l'opérateur, et ne voit que les robots qui s'identifient par leur user-agent. Ces chiffres viennent d'un éditeur d'outil de contrôle d'accès, à lire comme tels, et ils convergent avec ce qu'OpenAI écrit. Le rapport ajoute que le site européen médian voit ses consignes ignorées 2,8 fois plus souvent qu'un site nord-américain, que les scrapes IA médians par site y sont quatre fois plus élevés, et qu'il faut 179 visites de robots IA pour une visite humaine renvoyée par les applications IA chez les éditeurs européens.
Le blocage qui coûte cher, OAI-SearchBot et la disparition des réponses ChatGPT
Voici l'erreur que produit une règle générique contre tout ce qui ressemble à OpenAI, posée par un site qui a voulu « bloquer les IA » en bloc. Le site croit couper le fetch, il coupe la recherche. Abondance le résume, bloquer ChatGPT-User ne bloque pas OAI-SearchBot, l'agent qui décide si un site apparaît dans les résultats de recherche de ChatGPT. Interdire les deux fait perdre la visibilité côté recherche sans rien gagner côté fetch.
Le coût est documenté par OpenAI lui-même, un site sorti d'OAI-SearchBot n'est pas montré dans les réponses de recherche de ChatGPT, il peut tout au plus apparaître en lien de navigation. OpenAI prévient que ses systèmes peuvent mettre environ 24 heures à s'ajuster après une mise à jour de robots.txt, la correction d'une ligne héritée d'un ancien prestataire peut donc ne pas être répercutée pendant ce délai, et rien n'est dit du délai de retour dans les réponses.
La question pour une PME n'est pas de savoir si ChatGPT lira vos pages, il le fera si un utilisateur le lui demande, mais si votre site figure dans ses réponses quand un prospect compare des prestataires. Notre guide pour optimiser un site pour ChatGPT Search détaille ce qui fait remonter un site, la première condition est de ne pas s'en exclure.
Deuxième leçon, Disallow plus noindex, le noindex n'est jamais lu
Le 28 juillet 2026, Barry Schwartz rapportait dans Search Engine Land l'enquête de Wired, des conversations Claude partagées par leurs auteurs via une URL publique de type claude.ai/share sont apparues dans Google, Bing et d'autres moteurs, sujets sensibles compris, politique, santé. Une commande site sur claude.ai/share renvoyait des centaines de conversations le week-end précédent, retirées au moment de l'article.
Le mécanisme en cause est une règle que Google écrit dans sa propre documentation, « For the noindex rule to be effective, the page or resource must not be blocked by a robots.txt file ». Une page bloquée dans robots.txt et porteuse d'un noindex n'est jamais visitée, la balise n'est jamais lue, et la page peut rester dans les résultats, par exemple parce que d'autres pages la lient. Glenn Gabe l'a rappelé sur X, Google et Bing ne peuvent pas voir un noindex sur une page qu'ils n'ont pas le droit d'explorer.
Un point de prudence, que ce cumul soit la cause exacte côté Anthropic est une déduction de la presse SEO, Anthropic n'a pas commenté auprès de Wired, Bing non plus. Ned Adriance, porte-parole de Google, a rappelé à Wired que Google donne aux sites des contrôles clairs sur l'exploration et l'indexation et qu'il les respecte toujours. L'affaire prouve la règle, pas la faute.
Un dirigeant qui ajoute une ligne Disallow pour « bloquer les robots IA » sur un espace client ou une page de partage empêche en même temps Google de lire un noindex déjà posé. Il fabrique la configuration que la presse SEO a pointée dans l'affaire des conversations Claude.
Ce qui protège vraiment vos pages
Le fichier robots.txt est une demande polie adressée aux robots qui veulent bien l'écouter. Voici les leviers qui font autre chose qu'une demande, en gardant en tête qu'un contrôle d'indexation, d'affichage ou d'usage respecté par les opérateurs n'empêche pas l'accès au contenu, seule une authentification ou un blocage réseau le fait.
- noindex sans Disallow. Pour retirer une page de Google, la page reste explorable et porte la balise noindex, seule façon pour le robot de lire l'instruction.
- nosnippet, data-nosnippet et max-snippet. La documentation Google sur les fonctionnalités d'IA, mise à jour le 31 décembre 2025, indique que ces commandes limitent ce que Google affiche à partir de vos pages, Aperçus IA et Mode IA compris. Un data-nosnippet sur votre grille tarifaire limite l'affichage du passage dans les résultats Google sans retirer la page, il n'empêche pas sa lecture.
- Google-Extended. Selon la même documentation, il limite l'entraînement et l'ancrage de l'IA dans certains autres systèmes de Google, l'exploration pour la recherche restant pilotée par les directives robots.txt pour Googlebot.
- GPTBot en Disallow. Le seul réglage qui parle d'entraînement chez OpenAI, sans effet sur la recherche ni sur le fetch à la demande.
- Logs serveur et données CDN. Abondance le formule bien, robots.txt ne montre que ce qui a été demandé en théorie, seuls les logs serveur ou les données CDN montrent ce qui a été récupéré. OpenAI publie les plages d'IP de ses robots, on les reconnaît donc dans les logs.
- Le blocage réseau. Cloudflare l'a annoncé le 1er juillet 2026 sur son blog et son changelog, et Abondance l'a relayé, à partir du 15 septembre 2026 les robots d'entraînement et les agents sont bloqués par défaut sur les pages avec publicité des nouveaux domaines ajoutés à Cloudflare, robots de recherche autorisés, réglage modifiable dans la sécurité du compte. Un blocage réseau ne dépend plus de la bonne volonté du robot.
Un mot sur llms.txt, que des prestataires vendent encore comme un contrôle d'accès. Ce n'est pas une protection, et la documentation Google précise qu'aucun fichier textuel d'IA n'est nécessaire pour apparaître dans ses fonctionnalités. Nous avons expliqué pourquoi Google juge le fichier llms.txt inutile.
La matrice de décision selon votre objectif
La question « faut-il bloquer les IA » n'a pas une réponse, elle en a quatre, une par objectif.
- Rester visible dans ChatGPT. Autoriser OAI-SearchBot dans robots.txt et ses plages d'IP au niveau du pare-feu ou du CDN, vérifier qu'aucune règle héritée ne le bloque, compter environ 24 heures de prise en compte, délai qu'OpenAI donne comme possible.
- Refuser l'entraînement. Une ligne Disallow pour GPTBot chez OpenAI, la commande Google-Extended chez Google. Aucun effet sur votre présence dans la recherche.
- Retirer une page de Google. Balise noindex, page laissée explorable, aucune ligne Disallow sur cette URL, contrôle par l'outil d'inspection d'URL de la Search Console. Google prévient que la réexploration peut prendre plusieurs jours, voire plusieurs mois.
- Protéger un contenu payant ou confidentiel. Ni robots.txt ni noindex ne suffisent, le fetch à la demande passe. Authentification, blocage des agents au niveau du réseau, contrôle dans les logs.
Côté Google, nous avons détaillé le choix entre rester présent et exclure son site des Aperçus IA via la Search Console, et notre position ne change pas, on ne s'exclut pas d'une surface où ses concurrents restent visibles.
Comment Transacts audite l'accès des robots IA chez ses clients
Nous partons des logs, pas du seul fichier robots.txt. Sur 30 jours, nous relevons les requêtes des user-agents d'OpenAI, de Perplexity, d'Anthropic et des autres robots identifiés, nous les croisons avec les plages d'IP publiées, et nous comparons ce qui a été récupéré avec ce que le fichier prétendait interdire. L'écart entre les deux est le vrai diagnostic.
Ensuite nous relisons robots.txt ligne par ligne, blocages hérités d'un ancien prestataire, règles trop larges qui attrapent OAI-SearchBot, URL qui cumulent Disallow et noindex. Chaque URL sensible passe une commande site sur Google avant et après correction, et la décision est documentée par objectif.
La langue arrive souvent au même moment, ChatGPT-User va chercher une page pour répondre à l'utilisateur, et nous avons vu ce que cela implique pour la version anglaise d'un site face à ChatGPT. Cet audit s'inscrit dans le travail global de notre agence SEO, il ne se vend pas seul.
FAQ, bloquer ChatGPT et les robots IA
Comment bloquer ChatGPT sur mon site ?
Cela dépend de ce que vous voulez bloquer. Pour refuser l'entraînement, une ligne User-agent pour GPTBot suivie d'un Disallow est le réglage documenté par OpenAI, il indique que votre contenu ne doit pas servir à l'entraînement. Pour empêcher ChatGPT de lire une page à la demande d'un utilisateur, robots.txt ne suffit pas, OpenAI écrit que ses règles peuvent ne pas s'appliquer à ChatGPT-User. Il faut une authentification ou un blocage réseau, et un contrôle dans les logs. Et ne touchez pas à OAI-SearchBot si vous voulez rester dans les réponses de ChatGPT.
Bloquer GPTBot fait-il disparaître mon site de ChatGPT ?
Non. GPTBot ne concerne que l'entraînement des modèles d'OpenAI, et la documentation précise que chaque réglage est indépendant. Ce qui fait disparaître un site des réponses de recherche de ChatGPT, c'est le blocage d'OAI-SearchBot, avec environ 24 heures de prise en compte, délai possible selon OpenAI. Vous pouvez donc refuser l'entraînement et rester visible, à condition de viser le bon robot et de vérifier qu'une règle générique contre OpenAI n'attrape pas les deux.
Pourquoi une page en noindex reste-t-elle dans Google ?
Souvent parce qu'elle est aussi bloquée dans robots.txt, la première cause à vérifier avant le délai de réexploration ou une balise mal posée. Google le dit dans sa documentation, pour que noindex soit efficace, la page ne doit pas être bloquée par robots.txt. Si le robot ne peut pas explorer la page, il ne voit jamais la balise, et la page peut rester indexée si d'autres pages la lient. C'est le mécanisme mis en avant en juillet 2026 à propos des conversations Claude visibles dans Google. Retirez la ligne Disallow, puis contrôlez avec l'outil d'inspection d'URL.
Faut-il bloquer les IA ?
Pas en bloc. Bloquer l'entraînement est un choix légitime qui ne coûte rien en visibilité, si vous ciblez GPTBot et Google-Extended. Bloquer la recherche vous retire des réponses que vos prospects lisent, sans protéger vos pages, puisque le fetch à la demande passe. Selon Abondance, qui relaie le rapport TollBit, la plupart des agents récents ont des taux de blocage à un chiffre en Europe, ChatGPT-User faisant exception, vos concurrents restent donc pour la plupart ouverts. La bonne question est, par page, quel usage vous refusez.
Vous voulez rester visible dans ChatGPT sans exposer vos pages ?
Agence digitale à Paris depuis 1999. Nous auditons l'accès réel des robots IA dans vos logs, et nous corrigeons robots.txt et vos balises objectif par objectif. Commencez par situer votre site avec notre score GEO. Devis gratuit sous 48h.
Contactez-nous au 01 43 13 23 70