Vérifiez en un clic si GPTBot, ClaudeBot, Google-Extended et les autres robots d’IA peuvent lire vos pages — ou si votre robots.txt les bloque silencieusement.
Les robots d’IA sont des bots exploités par des entreprises comme OpenAI, Anthropic et Google pour lire les pages publiques et alimenter leurs modèles et moteurs de réponse. S’ils peuvent lire votre site, votre marque peut apparaître dans ChatGPT, Claude, Perplexity et les AI Overviews.
Votre fichier robots.txt — un fichier texte à la racine de votre domaine — indique à ces bots ce qu’ils peuvent ou non consulter. Une seule ligne Disallow peut vous retirer silencieusement des réponses d’IA.
Indiquez l’adresse de votre site. Nous récupérons votre fichier public /robots.txt.
Nous confrontons chaque grand robot d’IA à vos règles User-agent et Disallow.
Obtenez un statut autorisé / bloqué clair pour chaque robot d’IA en quelques secondes.
Votre fichier robots.txt est un fichier texte placé à la racine de votre domaine qui indique aux robots automatisés les parties de votre site qu’ils peuvent ou non récupérer. Pendant vingt ans, il a régi les robots des moteurs de recherche comme Googlebot. Aujourd’hui, il a une seconde mission tout aussi importante : décider quels crawlers IA — les robots qui alimentent ChatGPT, Perplexity, Claude et les réponses génératives de Google — sont autorisés à lire votre contenu.
Les éditeurs d’IA utilisent des user-agents distincts pour des usages distincts. OpenAI utilise GPTBot pour collecter des données d’entraînement, OAI-SearchBot pour alimenter les réponses de recherche en direct dans ChatGPT, et ChatGPT-User pour les récupérations à la demande lorsqu’un utilisateur demande à ChatGPT d’ouvrir un lien. Anthropic exploite ClaudeBot et l’ancien anthropic-ai. Perplexity utilise PerplexityBot. Google utilise Google-Extended comme jeton de désinscription pour l’entraînement de Gemini, distinct de son crawler de recherche Googlebot. Le CCBot de Common Crawl alimente de nombreux modèles en aval, et Bytespider (ByteDance), Amazonbot et Applebot-Extended complètent la liste.
L’essentiel à comprendre, c’est que ces robots font des choses différentes : un blocage généralisé est rarement la bonne décision. Bloquer un crawler d’entraînement protège votre contenu d’une absorption dans un modèle, mais bloquer un robot de récupération en direct comme OAI-SearchBot ou PerplexityBot peut discrètement vous retirer des réponses IA que voient vos acheteurs — l’équivalent IA d’une désindexation de Google. La plupart des marques veulent l’inverse : une visibilité maximale dans les réponses IA, avec un contrôle sélectif du scraping en masse.
robots.txt est une directive, pas un mur infranchissable. Les crawlers respectables d’OpenAI, Anthropic, Perplexity et Google le respectent, mais il repose sur la décision du robot d’obéir. C’est la manière standard et sans friction d’exprimer vos préférences, et l’associer à un fichier llms.txt offre aux systèmes IA bien élevés une carte claire du contenu que vous souhaitez le plus voir utilisé.
Une séquence pratique pour auditer ce que vous autorisez aujourd’hui, ouvrir les portes qui développent votre visibilité IA et fermer celles que vous ne voulez pas — sans vous cacher par accident de ChatGPT et Perplexity.
Passez votre domaine dans ce vérificateur pour voir quels user-agents IA vous autorisez, bloquez ou bloquez partiellement aujourd’hui. Beaucoup de sites bloquent GPTBot ou PerplexityBot sans le savoir, à cause d’une règle copiée-collée ou d’un réglage par défaut d’un plugin de sécurité.
Séparez les robots de récupération en direct (OAI-SearchBot, ChatGPT-User, PerplexityBot) des robots d’entraînement (GPTBot, Google-Extended, CCBot, ClaudeBot). La plupart des marques autorisent les robots de récupération pour la visibilité et font un choix délibéré sur les robots d’entraînement.
Pour apparaître dans les réponses de ChatGPT et Perplexity, autorisez explicitement OAI-SearchBot, ChatGPT-User et PerplexityBot. Si vous voulez que votre contenu serve aussi à l’entraînement, autorisez également GPTBot et ClaudeBot.
Si la bande passante, le scraping en masse ou la réutilisation sans attribution vous préoccupent, ajoutez des règles Disallow pour des crawlers agressifs comme Bytespider, CCBot ou Amazonbot, tout en laissant les robots des moteurs de réponse autorisés.
Utilisez un bloc User-agent par robot, nommez le user-agent à l’identique, puis placez Allow: / ou Disallow: / en dessous. Une règle finale trop large peut bloquer bien plus que prévu : gardez chaque directive bien circonscrite.
Relancez ce vérificateur après avoir modifié robots.txt pour confirmer que chaque robot se lit comme prévu. Vérifiez que le fichier renvoie un HTTP 200 sur /robots.txt et qu’il n’est pas bloqué par un pare-feu, un CDN ou une règle WAF.
Publiez un llms.txt qui répertorie vos pages et votre documentation les plus importantes. Il complète robots.txt en orientant les systèmes IA bien élevés vers le contenu que vous souhaitez le plus voir cité.
Les éditeurs d’IA ajoutent et renomment régulièrement des user-agents. Revérifiez chaque trimestre, surveillez vos journaux serveur à la recherche de nouveaux robots IA et confirmez qu’une mise à jour de CDN ou un nouveau plugin n’a pas modifié vos règles en silence.
Le vocabulaire du contrôle des robots IA, en termes simples.
Si vos acheteurs vous recherchent via des assistants IA, votre robots.txt décide désormais s’ils peuvent vous lire.
Décidez délibérément d’autoriser ou non des crawlers d’entraînement comme GPTBot et CCBot, tout en laissant autorisés les robots de moteurs de réponse comme OAI-SearchBot et PerplexityBot afin que vos contenus restent cités.
Confirmez que ChatGPT et Perplexity peuvent lire votre documentation et vos pages de fonctionnalités, afin que, lorsque les acheteurs demandent à l’IA le meilleur outil de votre catégorie, votre site soit disponible pour être cité.
Assurez-vous que vos pages produits et catégories sont explorables par les réponses d’achat IA, et limitez sélectivement les scrapers agressifs qui sollicitent vos serveurs sans envoyer de trafic.
Auditez le robots.txt d’un client en quelques secondes, repérez les blocages accidentels de GPTBot ou PerplexityBot et transformez le correctif en un gain de visibilité IA clair et mesurable.
L’accès n’est que la première étape. Découvrez si les moteurs d’IA recommandent vraiment votre marque — et comment y parvenir.
Obtenir mon score RAIVE gratuit