OUTIL GRATUIT

Les robots d’IA ont-ils accès à votre site ?

Vérifiez en un clic si GPTBot, ClaudeBot, Google-Extended et les autres robots d’IA peuvent lire vos pages — ou si votre robots.txt les bloque silencieusement.

Nous lisons votre fichier public /robots.txt. Rien n’est conservé.

Qu’est-ce qu’un robot d’IA ?

Les robots d’IA sont des bots exploités par des entreprises comme OpenAI, Anthropic et Google pour lire les pages publiques et alimenter leurs modèles et moteurs de réponse. S’ils peuvent lire votre site, votre marque peut apparaître dans ChatGPT, Claude, Perplexity et les AI Overviews.

Votre fichier robots.txt — un fichier texte à la racine de votre domaine — indique à ces bots ce qu’ils peuvent ou non consulter. Une seule ligne Disallow peut vous retirer silencieusement des réponses d’IA.

Comment ça marche

1

Saisissez votre domaine

Indiquez l’adresse de votre site. Nous récupérons votre fichier public /robots.txt.

2

Nous analysons les règles

Nous confrontons chaque grand robot d’IA à vos règles User-agent et Disallow.

3

Voyez qui est bloqué

Obtenez un statut autorisé / bloqué clair pour chaque robot d’IA en quelques secondes.

Comment robots.txt contrôle les crawlers IA en 2026

Votre fichier robots.txt est un fichier texte placé à la racine de votre domaine qui indique aux robots automatisés les parties de votre site qu’ils peuvent ou non récupérer. Pendant vingt ans, il a régi les robots des moteurs de recherche comme Googlebot. Aujourd’hui, il a une seconde mission tout aussi importante : décider quels crawlers IA — les robots qui alimentent ChatGPT, Perplexity, Claude et les réponses génératives de Google — sont autorisés à lire votre contenu.

Les éditeurs d’IA utilisent des user-agents distincts pour des usages distincts. OpenAI utilise GPTBot pour collecter des données d’entraînement, OAI-SearchBot pour alimenter les réponses de recherche en direct dans ChatGPT, et ChatGPT-User pour les récupérations à la demande lorsqu’un utilisateur demande à ChatGPT d’ouvrir un lien. Anthropic exploite ClaudeBot et l’ancien anthropic-ai. Perplexity utilise PerplexityBot. Google utilise Google-Extended comme jeton de désinscription pour l’entraînement de Gemini, distinct de son crawler de recherche Googlebot. Le CCBot de Common Crawl alimente de nombreux modèles en aval, et Bytespider (ByteDance), Amazonbot et Applebot-Extended complètent la liste.

L’essentiel à comprendre, c’est que ces robots font des choses différentes : un blocage généralisé est rarement la bonne décision. Bloquer un crawler d’entraînement protège votre contenu d’une absorption dans un modèle, mais bloquer un robot de récupération en direct comme OAI-SearchBot ou PerplexityBot peut discrètement vous retirer des réponses IA que voient vos acheteurs — l’équivalent IA d’une désindexation de Google. La plupart des marques veulent l’inverse : une visibilité maximale dans les réponses IA, avec un contrôle sélectif du scraping en masse.

robots.txt est une directive, pas un mur infranchissable. Les crawlers respectables d’OpenAI, Anthropic, Perplexity et Google le respectent, mais il repose sur la décision du robot d’obéir. C’est la manière standard et sans friction d’exprimer vos préférences, et l’associer à un fichier llms.txt offre aux systèmes IA bien élevés une carte claire du contenu que vous souhaitez le plus voir utilisé.

Comment contrôler les crawlers IA avec robots.txt

Une séquence pratique pour auditer ce que vous autorisez aujourd’hui, ouvrir les portes qui développent votre visibilité IA et fermer celles que vous ne voulez pas — sans vous cacher par accident de ChatGPT et Perplexity.

1

Auditez vos règles actuelles

Passez votre domaine dans ce vérificateur pour voir quels user-agents IA vous autorisez, bloquez ou bloquez partiellement aujourd’hui. Beaucoup de sites bloquent GPTBot ou PerplexityBot sans le savoir, à cause d’une règle copiée-collée ou d’un réglage par défaut d’un plugin de sécurité.

2

Définissez votre stratégie autoriser/bloquer

Séparez les robots de récupération en direct (OAI-SearchBot, ChatGPT-User, PerplexityBot) des robots d’entraînement (GPTBot, Google-Extended, CCBot, ClaudeBot). La plupart des marques autorisent les robots de récupération pour la visibilité et font un choix délibéré sur les robots d’entraînement.

3

Autorisez les crawlers IA qui comptent

Pour apparaître dans les réponses de ChatGPT et Perplexity, autorisez explicitement OAI-SearchBot, ChatGPT-User et PerplexityBot. Si vous voulez que votre contenu serve aussi à l’entraînement, autorisez également GPTBot et ClaudeBot.

4

Bloquez les scrapers indésirables

Si la bande passante, le scraping en masse ou la réutilisation sans attribution vous préoccupent, ajoutez des règles Disallow pour des crawlers agressifs comme Bytespider, CCBot ou Amazonbot, tout en laissant les robots des moteurs de réponse autorisés.

5

Écrivez une syntaxe correcte et précise

Utilisez un bloc User-agent par robot, nommez le user-agent à l’identique, puis placez Allow: / ou Disallow: / en dessous. Une règle finale trop large peut bloquer bien plus que prévu : gardez chaque directive bien circonscrite.

6

Testez avant et après publication

Relancez ce vérificateur après avoir modifié robots.txt pour confirmer que chaque robot se lit comme prévu. Vérifiez que le fichier renvoie un HTTP 200 sur /robots.txt et qu’il n’est pas bloqué par un pare-feu, un CDN ou une règle WAF.

7

Ajoutez un llms.txt pour guider les bons robots

Publiez un llms.txt qui répertorie vos pages et votre documentation les plus importantes. Il complète robots.txt en orientant les systèmes IA bien élevés vers le contenu que vous souhaitez le plus voir cité.

8

Surveillez l’activité des crawlers dans le temps

Les éditeurs d’IA ajoutent et renomment régulièrement des user-agents. Revérifiez chaque trimestre, surveillez vos journaux serveur à la recherche de nouveaux robots IA et confirmez qu’une mise à jour de CDN ou un nouveau plugin n’a pas modifié vos règles en silence.

Glossaire des crawlers IA et de robots.txt

Le vocabulaire du contrôle des robots IA, en termes simples.

robots.txt
Un fichier texte à la racine de votre domaine (votresite.com/robots.txt) qui indique aux crawlers les chemins qu’ils peuvent ou non récupérer. La manière standard d’exprimer vos préférences d’exploration aux robots de recherche et d’IA.
User-agent
L’identifiant qu’un robot envoie pour annoncer qui il est. Dans robots.txt, chaque ligne User-agent nomme le robot auquel s’applique un bloc de règles, comme GPTBot ou PerplexityBot.
Disallow
Une directive qui demande à un user-agent nommé de ne pas récupérer le chemin indiqué. Disallow: / bloque tout le site pour ce robot ; Disallow: /private/ ne bloque que ce dossier.
Allow
Une directive qui autorise explicitement un chemin, utilisée pour créer des exceptions au sein d’un Disallow plus large ou pour accorder clairement l’accès à un robot précis.
Crawl-delay
Une directive facultative demandant un nombre minimal de secondes entre les requêtes d’un robot, pour limiter la charge serveur. Respectée par certains crawlers mais pas par tous les robots IA.
GPTBot
Le crawler d’OpenAI qui collecte le contenu web servant à entraîner ses modèles. Bloquer GPTBot retire votre contenu de l’entraînement mais ne vous retire pas, à lui seul, des réponses de recherche en direct de ChatGPT.
Google-Extended
Un jeton robots.txt utilisé par Google pour vous permettre de refuser que votre contenu serve à entraîner et alimenter Gemini, distinct du crawler Googlebot qui alimente la recherche. Le bloquer n’affecte pas votre classement dans Google Search.
llms.txt
Un fichier texte proposé qui répertorie vos pages clés et votre documentation sous une forme propre et lisible par machine, afin que les systèmes IA trouvent votre contenu le plus important. Il complète robots.txt sans le remplacer.
Crawler IA
Un robot exploité par un éditeur d’IA pour récupérer des pages web à des fins d’entraînement, de récupération en direct ou de navigation à la demande. Exemples : GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot et CCBot.
Robot de récupération en direct
Un crawler IA qui récupère des pages au moment de répondre pour fonder sa réponse, comme OAI-SearchBot, ChatGPT-User et PerplexityBot. Les bloquer peut vous retirer des réponses IA.
Crawler d’entraînement
Un robot qui collecte du contenu pour entraîner un modèle plutôt que pour répondre à une requête en direct, comme GPTBot, Google-Extended, CCBot et Bytespider.

Qui utilise le vérificateur Robots.txt

Si vos acheteurs vous recherchent via des assistants IA, votre robots.txt décide désormais s’ils peuvent vous lire.

Éditeurs et médias

Décidez délibérément d’autoriser ou non des crawlers d’entraînement comme GPTBot et CCBot, tout en laissant autorisés les robots de moteurs de réponse comme OAI-SearchBot et PerplexityBot afin que vos contenus restent cités.

SaaS et logiciels

Confirmez que ChatGPT et Perplexity peuvent lire votre documentation et vos pages de fonctionnalités, afin que, lorsque les acheteurs demandent à l’IA le meilleur outil de votre catégorie, votre site soit disponible pour être cité.

E-commerce et DTC

Assurez-vous que vos pages produits et catégories sont explorables par les réponses d’achat IA, et limitez sélectivement les scrapers agressifs qui sollicitent vos serveurs sans envoyer de trafic.

Agences et consultants

Auditez le robots.txt d’un client en quelques secondes, repérez les blocages accidentels de GPTBot ou PerplexityBot et transformez le correctif en un gain de visibilité IA clair et mesurable.

Questions fréquentes

Qu’est-ce que GPTBot ?
GPTBot est le robot d’exploration d’OpenAI. Il lit les pages publiques pour entraîner et alimenter ses modèles. Le bloquer dans robots.txt empêche OpenAI d’utiliser votre contenu.
Faut-il autoriser les robots d’IA ?
Pour la plupart des marques, oui. Les autoriser permet à votre contenu d’apparaître dans les réponses de ChatGPT, Claude et Perplexity — une source de visibilité en forte croissance.
Bloquer dans robots.txt me retire-t-il de ChatGPT ?
Bloquer ChatGPT-User et GPTBot stoppe l’exploration et la récupération en direct, ce qui réduit vos citations. Cela n’efface pas ce qui a déjà été appris, mais limite votre visibilité future.
Qu’est-ce que Google-Extended ?
Google-Extended est un jeton robots.txt qui contrôle si Google peut utiliser votre contenu pour Gemini et ses fonctions d’IA, indépendamment de l’indexation classique de Google Search.
En quoi est-ce différent de Rankfender ?
Cet outil vérifie l’accès. Rankfender va plus loin : il mesure si les moteurs d’IA citent réellement votre marque et montre comment gagner ces citations.
Dois-je bloquer les crawlers IA ?
Pour la plupart des marques, non — du moins pas les robots de récupération en direct. Bloquer OAI-SearchBot, ChatGPT-User ou PerplexityBot peut vous retirer des réponses que les acheteurs voient dans ChatGPT et Perplexity. Le choix nuancé concerne les crawlers d’entraînement comme GPTBot, Google-Extended et CCBot : bloquez-les si vous ne voulez pas que votre contenu soit absorbé dans des modèles, mais sachez que tout bloquer sacrifie votre visibilité IA pour protéger un contenu que vous souhaitez peut-être justement faire découvrir.
Bloquer GPTBot me retire-t-il de ChatGPT ?
Pas directement. GPTBot est le crawler d’entraînement d’OpenAI, pas le robot qui récupère les pages pour les réponses en direct. Les réponses de recherche de ChatGPT sont alimentées par OAI-SearchBot, et l’ouverture de liens à la demande par ChatGPT-User. Si vous voulez rester hors de l’entraînement tout en demeurant visible dans les réponses de ChatGPT, bloquez GPTBot et autorisez OAI-SearchBot et ChatGPT-User.
Qu’est-ce que Google-Extended ?
Google-Extended est un jeton de user-agent robots.txt qui vous permet de refuser que votre contenu serve à entraîner et alimenter les modèles Gemini de Google. Il est distinct de Googlebot. Bloquer Google-Extended n’affecte pas votre classement dans Google Search ni votre présence dans la recherche normale — il ne régit que l’entraînement et l’alimentation de l’IA générative.
Autoriser les robots IA nuit-il au SEO ?
Non. Autoriser les crawlers IA ne nuit pas à votre classement Google classique ; Googlebot et les jetons d’entraînement IA comme Google-Extended sont régis séparément. Autoriser les robots des moteurs de réponse vous aide en réalité à apparaître dans ChatGPT et Perplexity, ce qui fait de plus en plus partie de la façon dont les acheteurs découvrent les marques. Il n’y a aucune pénalité SEO à laisser les crawlers IA lire votre contenu public.
Comment bloquer un crawler IA dans robots.txt ?
Ajoutez un bloc nommant le user-agent, puis une règle Disallow. Par exemple : User-agent: GPTBot puis Disallow: / bloque GPTBot sur tout le site. Répétez un bloc par robot que vous voulez restreindre. Après modification, relancez ce vérificateur et confirmez que /robots.txt renvoie un HTTP 200 pour que la règle soit réellement servie.
Quelle différence entre robots.txt et llms.txt ?
robots.txt contrôle quels robots peuvent récupérer quels chemins — c’est une couche d’autorisation. llms.txt est un fichier proposé qui répertorie vos pages et documentation les plus importantes pour que les systèmes IA trouvent rapidement votre meilleur contenu. Ils fonctionnent ensemble : robots.txt définit l’accès, llms.txt oriente les IA bien élevées vers ce que vous voulez le plus voir cité.
Les crawlers IA respecteront-ils mon robots.txt ?
Les crawlers respectables d’OpenAI, Anthropic, Perplexity et Google s’engagent publiquement à respecter robots.txt. C’est une directive, pas un blocage absolu : un scraper malveillant peut l’ignorer, mais les grands éditeurs d’IA qui alimentent les réponses de ChatGPT, Claude, Perplexity et Gemini le respectent, ce qui fait de robots.txt le point de contrôle pratique de la visibilité IA.
À quelle fréquence vérifier mon robots.txt pour les robots IA ?
Au moins chaque trimestre, et après tout changement de CDN, de plugin de sécurité ou de plateforme. Les éditeurs d’IA ajoutent ou renomment régulièrement des user-agents — Applebot-Extended et OAI-SearchBot en sont des exemples récents — de sorte qu’un fichier correct l’an dernier peut désormais ignorer de nouveaux robots ou porter un blocage obsolète. Relancer ce vérificateur prend quelques secondes et détecte les changements silencieux.

Autorisé ne veut pas dire cité

L’accès n’est que la première étape. Découvrez si les moteurs d’IA recommandent vraiment votre marque — et comment y parvenir.

Obtenir mon score RAIVE gratuit