FERRAMENTA GRÁTIS

Os rastreadores de IA têm acesso ao seu site?

Verifique num clique se GPTBot, ClaudeBot, Google-Extended e outros rastreadores de IA podem ler as suas páginas — ou se o seu robots.txt os está a bloquear em silêncio.

Lemos o seu ficheiro público /robots.txt. Nada é guardado.

O que é um rastreador de IA?

Os rastreadores de IA são bots de empresas como OpenAI, Anthropic e Google que leem páginas públicas para alimentar os seus modelos e motores de resposta. Se conseguirem ler o seu site, a sua marca pode aparecer no ChatGPT, Claude, Perplexity e nas AI Overviews.

O seu ficheiro robots.txt — um ficheiro de texto na raiz do domínio — indica a estes bots o que podem aceder. Uma única linha Disallow pode removê-lo silenciosamente das respostas de IA.

Como funciona

1

Introduza o domínio

Escreva o endereço do seu site. Obtemos o seu ficheiro público /robots.txt.

2

Analisamos as regras

Comparamos cada grande rastreador de IA com as suas regras User-agent e Disallow.

3

Veja quem está bloqueado

Obtenha um estado claro permitido / bloqueado para cada rastreador de IA em segundos.

Como o robots.txt controla os rastreadores de IA em 2026

O seu arquivo robots.txt é um arquivo de texto simples na raiz do seu domínio que informa aos bots automatizados quais partes do seu site eles podem e não podem buscar. Por duas décadas, governou os rastreadores de buscadores como o Googlebot. Hoje tem uma segunda tarefa, igualmente importante: decidir quais rastreadores de IA — os bots que alimentam o ChatGPT, o Perplexity, o Claude e as respostas generativas do Google — podem ler o seu conteúdo.

Os fornecedores de IA executam user-agents distintos para finalidades distintas. A OpenAI usa o GPTBot para coletar dados de treinamento, o OAI-SearchBot para alimentar respostas de busca ao vivo no ChatGPT e o ChatGPT-User para buscas sob demanda quando um usuário pede ao ChatGPT para abrir um link. A Anthropic opera o ClaudeBot e o antigo anthropic-ai. O Perplexity usa o PerplexityBot. O Google usa o Google-Extended como token de exclusão para o treinamento do Gemini, separado do seu rastreador de busca Googlebot. O CCBot da Common Crawl alimenta muitos modelos subsequentes, e o Bytespider (ByteDance), o Amazonbot e o Applebot-Extended completam a lista.

O ponto-chave é que esses bots fazem coisas diferentes, então um bloqueio geral raramente é a decisão certa. Bloquear um rastreador de treinamento protege o seu conteúdo de ser absorvido em um modelo, mas bloquear um bot de recuperação ao vivo como o OAI-SearchBot ou o PerplexityBot pode removê-lo silenciosamente das respostas de IA que os seus compradores veem — o equivalente em IA a desindexar-se do Google. A maioria das marcas quer o oposto: máxima visibilidade nas respostas de IA, com controle seletivo sobre a raspagem em massa.

O robots.txt é uma diretiva, não um muro intransponível. Os rastreadores respeitáveis da OpenAI, Anthropic, Perplexity e Google o respeitam, mas depende de o bot escolher obedecer. É a forma padrão e sem atrito de expressar as suas preferências, e combiná-lo com um arquivo llms.txt oferece aos sistemas de IA bem-educados um mapa claro do conteúdo que você mais quer ver utilizado.

Como controlar os rastreadores de IA com robots.txt

Uma sequência prática para auditar o que você permite hoje, abrir as portas que aumentam a sua visibilidade em IA e fechar as que não quer — sem se esconder por acidente do ChatGPT e do Perplexity.

1

Audite as suas regras atuais

Passe o seu domínio por este verificador para ver quais user-agents de IA você permite, bloqueia ou bloqueia parcialmente hoje. Muitos sites bloqueiam o GPTBot ou o PerplexityBot sem saber, por causa de uma regra copiada e colada ou de um padrão de plugin de segurança.

2

Defina a sua estratégia de permitir/bloquear

Separe os bots de recuperação ao vivo (OAI-SearchBot, ChatGPT-User, PerplexityBot) dos bots de treinamento (GPTBot, Google-Extended, CCBot, ClaudeBot). A maioria das marcas permite os bots de recuperação para visibilidade e faz uma escolha deliberada sobre os de treinamento.

3

Permita os rastreadores de IA que importam

Para aparecer nas respostas do ChatGPT e do Perplexity, permita explicitamente o OAI-SearchBot, o ChatGPT-User e o PerplexityBot. Se quiser que o seu conteúdo seja usado também no treinamento, permita também o GPTBot e o ClaudeBot.

4

Bloqueie os raspadores que você não quer

Se largura de banda, raspagem em massa ou reutilização sem atribuição forem uma preocupação, adicione regras Disallow para rastreadores agressivos como Bytespider, CCBot ou Amazonbot, mantendo permitidos os bots dos motores de resposta.

5

Escreva uma sintaxe correta e específica

Use um bloco User-agent por bot, nomeie o user-agent de forma idêntica e coloque Allow: / ou Disallow: / abaixo dele. Uma regra final ampla demais pode bloquear muito mais do que o pretendido, então mantenha cada diretiva bem delimitada.

6

Teste antes e depois de publicar

Execute novamente este verificador após editar o robots.txt para confirmar que cada bot é lido como você pretendia. Verifique se o arquivo retorna HTTP 200 em /robots.txt e se não está bloqueado por um firewall, uma CDN ou uma regra WAF.

7

Adicione um llms.txt para guiar os bots corretos

Publique um llms.txt que liste as suas páginas e documentação mais importantes. Ele complementa o robots.txt apontando os sistemas de IA bem-educados para o conteúdo que você mais quer ver citado.

8

Monitore a atividade dos rastreadores ao longo do tempo

Os fornecedores de IA adicionam e renomeiam user-agents com frequência. Verifique novamente a cada trimestre, observe os logs do servidor em busca de novos bots de IA e confirme que uma atualização de CDN ou um novo plugin não alterou as suas regras em silêncio.

Glossário de rastreadores de IA e robots.txt

O vocabulário para controlar os bots de IA, em linguagem clara.

robots.txt
Um arquivo de texto simples na raiz do seu domínio (seusite.com/robots.txt) que informa aos rastreadores quais caminhos eles podem e não podem buscar. A forma padrão de expressar as suas preferências de rastreamento aos bots de busca e de IA.
User-agent
O identificador que um bot envia para anunciar quem é. No robots.txt, cada linha User-agent nomeia o bot ao qual um bloco de regras se aplica, como GPTBot ou PerplexityBot.
Disallow
Uma diretiva que pede a um user-agent nomeado para não buscar o caminho indicado. Disallow: / bloqueia o site inteiro para esse bot; Disallow: /private/ bloqueia apenas aquela pasta.
Allow
Uma diretiva que permite explicitamente um caminho, usada para criar exceções dentro de um Disallow mais amplo ou para conceder acesso claro a um bot específico.
Crawl-delay
Uma diretiva opcional que solicita um número mínimo de segundos entre as requisições de um bot, para limitar a carga do servidor. Respeitada por alguns rastreadores, mas não por todos os bots de IA.
GPTBot
O rastreador da OpenAI que coleta conteúdo da web usado para treinar os seus modelos. Bloquear o GPTBot exclui o seu conteúdo do treinamento, mas não o remove, por si só, das respostas de busca ao vivo do ChatGPT.
Google-Extended
Um token de robots.txt que o Google usa para permitir que você exclua o seu conteúdo do treinamento e da fundamentação do Gemini, separado do rastreador Googlebot que alimenta a Busca. Bloqueá-lo não afeta o seu posicionamento no Google Search.
llms.txt
Um arquivo de texto proposto que lista as suas páginas e documentação principais de forma limpa e legível por máquina, para que os sistemas de IA encontrem o seu conteúdo mais importante. Complementa o robots.txt em vez de substituí-lo.
Rastreador de IA
Um bot operado por um fornecedor de IA para buscar páginas da web para fins de treinamento, recuperação ao vivo ou navegação sob demanda. Exemplos: GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot e CCBot.
Bot de recuperação ao vivo
Um rastreador de IA que busca páginas no momento da resposta para fundamentar uma resposta, como OAI-SearchBot, ChatGPT-User e PerplexityBot. Bloqueá-los pode removê-lo das respostas de IA.
Rastreador de treinamento
Um bot que coleta conteúdo para treinar um modelo em vez de responder a uma consulta ao vivo, como GPTBot, Google-Extended, CCBot e Bytespider.

Quem usa o verificador de Robots.txt

Se os compradores pesquisam você por meio de assistentes de IA, o seu robots.txt agora decide se eles podem ler você.

Editores e mídia

Decida deliberadamente se permite rastreadores de treinamento como GPTBot e CCBot, mantendo permitidos os bots de motores de resposta como OAI-SearchBot e PerplexityBot para que a sua reportagem continue sendo citada.

SaaS e software

Confirme que o ChatGPT e o Perplexity podem ler a sua documentação e páginas de funcionalidades, para que, quando os compradores perguntarem à IA pela melhor ferramenta da sua categoria, o seu site esteja disponível para ser citado.

E-commerce e DTC

Garanta que as páginas de produto e categoria sejam rastreáveis pelas respostas de compra de IA e limite seletivamente os raspadores agressivos que sobrecarregam os seus servidores sem enviar tráfego.

Agências e consultores

Audite o robots.txt de um cliente em segundos, identifique bloqueios acidentais do GPTBot ou do PerplexityBot e transforme a correção em um ganho de visibilidade em IA claro e mensurável.

Perguntas frequentes

O que é o GPTBot?
O GPTBot é o rastreador web da OpenAI. Lê páginas públicas para treinar e alimentar os seus modelos. Bloqueá-lo no robots.txt impede a OpenAI de usar o seu conteúdo.
Devo permitir os rastreadores de IA?
Para a maioria das marcas, sim. Permiti-los faz o seu conteúdo aparecer nas respostas do ChatGPT, Claude e Perplexity — uma fonte de descoberta em forte crescimento.
Bloquear o robots.txt remove-me do ChatGPT?
Bloquear o ChatGPT-User e o GPTBot trava o rastreio e a recolha em tempo real, reduzindo as citações. Não apaga o que já foi aprendido, mas limita a sua visibilidade futura.
O que é o Google-Extended?
O Google-Extended é um token do robots.txt que controla se a Google pode usar o seu conteúdo para o Gemini e funções de IA, em separado da indexação normal da Pesquisa Google.
Em que difere do Rankfender?
Esta ferramenta verifica o acesso. O Rankfender vai mais longe: mede se os motores de IA mencionam realmente a sua marca e mostra como conquistar essas citações.
Devo bloquear os rastreadores de IA?
Para a maioria das marcas, não — pelo menos não os bots de recuperação ao vivo. Bloquear o OAI-SearchBot, o ChatGPT-User ou o PerplexityBot pode removê-lo das respostas que os compradores veem no ChatGPT e no Perplexity. A escolha mais sutil é sobre os rastreadores de treinamento como GPTBot, Google-Extended e CCBot: bloqueie-os se não quiser que o seu conteúdo seja absorvido em modelos, mas saiba que bloquear tudo sacrifica a sua visibilidade em IA para proteger conteúdo que você talvez queira que seja descoberto de qualquer forma.
Bloquear o GPTBot me remove do ChatGPT?
Não diretamente. O GPTBot é o rastreador de treinamento da OpenAI, não o bot que busca páginas para as respostas ao vivo. As respostas de busca do ChatGPT são alimentadas pelo OAI-SearchBot, e a abertura de links sob demanda pelo ChatGPT-User. Se quiser ficar fora do treinamento mas permanecer visível nas respostas do ChatGPT, bloqueie o GPTBot e permita o OAI-SearchBot e o ChatGPT-User.
O que é o Google-Extended?
O Google-Extended é um token de user-agent do robots.txt que permite excluir o seu conteúdo do treinamento e da fundamentação dos modelos Gemini do Google. É separado do Googlebot. Bloquear o Google-Extended não afeta o seu posicionamento no Google Search nem a sua presença na busca normal — ele rege apenas o treinamento e a fundamentação da IA generativa.
Permitir bots de IA é ruim para o SEO?
Não. Permitir rastreadores de IA não prejudica o seu posicionamento clássico no Google; o Googlebot e os tokens de treinamento de IA como o Google-Extended são regidos separadamente. Permitir os bots de motores de resposta na verdade ajuda você a aparecer no ChatGPT e no Perplexity, o que é cada vez mais parte de como os compradores descobrem marcas. Não há penalidade de SEO por deixar os rastreadores de IA lerem o seu conteúdo público.
Como bloqueio um rastreador de IA no robots.txt?
Adicione um bloco que nomeie o user-agent e, em seguida, uma regra Disallow. Por exemplo: User-agent: GPTBot e depois Disallow: / bloqueia o GPTBot no site inteiro. Repita um bloco por bot que você queira restringir. Após editar, execute novamente este verificador e confirme que /robots.txt retorna HTTP 200 para que a regra seja realmente servida.
Qual a diferença entre robots.txt e llms.txt?
O robots.txt controla quais bots podem buscar quais caminhos — é uma camada de permissão. O llms.txt é um arquivo proposto que lista as suas páginas e documentação mais importantes para que os sistemas de IA encontrem rapidamente o seu melhor conteúdo. Eles trabalham juntos: o robots.txt define o acesso, o llms.txt orienta a IA bem-educada para o que você mais quer ver citado.
Os rastreadores de IA vão obedecer ao meu robots.txt?
Os rastreadores respeitáveis da OpenAI, Anthropic, Perplexity e Google se comprometem publicamente a respeitar o robots.txt. É uma diretiva, não um bloqueio absoluto, então um raspador malicioso pode ignorá-lo — mas os grandes fornecedores de IA que alimentam as respostas do ChatGPT, do Claude, do Perplexity e do Gemini o respeitam, o que torna o robots.txt o ponto de controle prático para a visibilidade em IA.
Com que frequência devo verificar o meu robots.txt para os bots de IA?
Pelo menos a cada trimestre, e após qualquer mudança de CDN, plugin de segurança ou plataforma. Os fornecedores de IA adicionam ou renomeiam user-agents com regularidade — Applebot-Extended e OAI-SearchBot são exemplos recentes — então um arquivo correto no ano passado pode agora ignorar novos bots ou carregar um bloqueio obsoleto. Executar novamente este verificador leva segundos e detecta as mudanças silenciosas.

Permitido não é o mesmo que mencionado

O acesso é só o primeiro passo. Veja se os motores de IA recomendam mesmo a sua marca — e como consegui-lo.

Obter a minha pontuação RAIVE grátis