Verifique num clique se GPTBot, ClaudeBot, Google-Extended e outros rastreadores de IA podem ler as suas páginas — ou se o seu robots.txt os está a bloquear em silêncio.
Os rastreadores de IA são bots de empresas como OpenAI, Anthropic e Google que leem páginas públicas para alimentar os seus modelos e motores de resposta. Se conseguirem ler o seu site, a sua marca pode aparecer no ChatGPT, Claude, Perplexity e nas AI Overviews.
O seu ficheiro robots.txt — um ficheiro de texto na raiz do domínio — indica a estes bots o que podem aceder. Uma única linha Disallow pode removê-lo silenciosamente das respostas de IA.
Escreva o endereço do seu site. Obtemos o seu ficheiro público /robots.txt.
Comparamos cada grande rastreador de IA com as suas regras User-agent e Disallow.
Obtenha um estado claro permitido / bloqueado para cada rastreador de IA em segundos.
O seu arquivo robots.txt é um arquivo de texto simples na raiz do seu domínio que informa aos bots automatizados quais partes do seu site eles podem e não podem buscar. Por duas décadas, governou os rastreadores de buscadores como o Googlebot. Hoje tem uma segunda tarefa, igualmente importante: decidir quais rastreadores de IA — os bots que alimentam o ChatGPT, o Perplexity, o Claude e as respostas generativas do Google — podem ler o seu conteúdo.
Os fornecedores de IA executam user-agents distintos para finalidades distintas. A OpenAI usa o GPTBot para coletar dados de treinamento, o OAI-SearchBot para alimentar respostas de busca ao vivo no ChatGPT e o ChatGPT-User para buscas sob demanda quando um usuário pede ao ChatGPT para abrir um link. A Anthropic opera o ClaudeBot e o antigo anthropic-ai. O Perplexity usa o PerplexityBot. O Google usa o Google-Extended como token de exclusão para o treinamento do Gemini, separado do seu rastreador de busca Googlebot. O CCBot da Common Crawl alimenta muitos modelos subsequentes, e o Bytespider (ByteDance), o Amazonbot e o Applebot-Extended completam a lista.
O ponto-chave é que esses bots fazem coisas diferentes, então um bloqueio geral raramente é a decisão certa. Bloquear um rastreador de treinamento protege o seu conteúdo de ser absorvido em um modelo, mas bloquear um bot de recuperação ao vivo como o OAI-SearchBot ou o PerplexityBot pode removê-lo silenciosamente das respostas de IA que os seus compradores veem — o equivalente em IA a desindexar-se do Google. A maioria das marcas quer o oposto: máxima visibilidade nas respostas de IA, com controle seletivo sobre a raspagem em massa.
O robots.txt é uma diretiva, não um muro intransponível. Os rastreadores respeitáveis da OpenAI, Anthropic, Perplexity e Google o respeitam, mas depende de o bot escolher obedecer. É a forma padrão e sem atrito de expressar as suas preferências, e combiná-lo com um arquivo llms.txt oferece aos sistemas de IA bem-educados um mapa claro do conteúdo que você mais quer ver utilizado.
Uma sequência prática para auditar o que você permite hoje, abrir as portas que aumentam a sua visibilidade em IA e fechar as que não quer — sem se esconder por acidente do ChatGPT e do Perplexity.
Passe o seu domínio por este verificador para ver quais user-agents de IA você permite, bloqueia ou bloqueia parcialmente hoje. Muitos sites bloqueiam o GPTBot ou o PerplexityBot sem saber, por causa de uma regra copiada e colada ou de um padrão de plugin de segurança.
Separe os bots de recuperação ao vivo (OAI-SearchBot, ChatGPT-User, PerplexityBot) dos bots de treinamento (GPTBot, Google-Extended, CCBot, ClaudeBot). A maioria das marcas permite os bots de recuperação para visibilidade e faz uma escolha deliberada sobre os de treinamento.
Para aparecer nas respostas do ChatGPT e do Perplexity, permita explicitamente o OAI-SearchBot, o ChatGPT-User e o PerplexityBot. Se quiser que o seu conteúdo seja usado também no treinamento, permita também o GPTBot e o ClaudeBot.
Se largura de banda, raspagem em massa ou reutilização sem atribuição forem uma preocupação, adicione regras Disallow para rastreadores agressivos como Bytespider, CCBot ou Amazonbot, mantendo permitidos os bots dos motores de resposta.
Use um bloco User-agent por bot, nomeie o user-agent de forma idêntica e coloque Allow: / ou Disallow: / abaixo dele. Uma regra final ampla demais pode bloquear muito mais do que o pretendido, então mantenha cada diretiva bem delimitada.
Execute novamente este verificador após editar o robots.txt para confirmar que cada bot é lido como você pretendia. Verifique se o arquivo retorna HTTP 200 em /robots.txt e se não está bloqueado por um firewall, uma CDN ou uma regra WAF.
Publique um llms.txt que liste as suas páginas e documentação mais importantes. Ele complementa o robots.txt apontando os sistemas de IA bem-educados para o conteúdo que você mais quer ver citado.
Os fornecedores de IA adicionam e renomeiam user-agents com frequência. Verifique novamente a cada trimestre, observe os logs do servidor em busca de novos bots de IA e confirme que uma atualização de CDN ou um novo plugin não alterou as suas regras em silêncio.
O vocabulário para controlar os bots de IA, em linguagem clara.
Se os compradores pesquisam você por meio de assistentes de IA, o seu robots.txt agora decide se eles podem ler você.
Decida deliberadamente se permite rastreadores de treinamento como GPTBot e CCBot, mantendo permitidos os bots de motores de resposta como OAI-SearchBot e PerplexityBot para que a sua reportagem continue sendo citada.
Confirme que o ChatGPT e o Perplexity podem ler a sua documentação e páginas de funcionalidades, para que, quando os compradores perguntarem à IA pela melhor ferramenta da sua categoria, o seu site esteja disponível para ser citado.
Garanta que as páginas de produto e categoria sejam rastreáveis pelas respostas de compra de IA e limite seletivamente os raspadores agressivos que sobrecarregam os seus servidores sem enviar tráfego.
Audite o robots.txt de um cliente em segundos, identifique bloqueios acidentais do GPTBot ou do PerplexityBot e transforme a correção em um ganho de visibilidade em IA claro e mensurável.
O acesso é só o primeiro passo. Veja se os motores de IA recomendam mesmo a sua marca — e como consegui-lo.
Obter a minha pontuação RAIVE grátis